فایل Robots.txt فایلی متنی در ریشه وبسایت است که به رباتهای موتورهای جستجو (مانند Googlebot) دستور میدهد کدام بخشهای وبسایت را خزش (crawl) کنند و کدام را نادیده بگیرند.
ساختار فایل Robots.txt
User-agent: *
Disallow: /admin/
Disallow: /workspace/
Allow: /blog/
Sitemap: https://example.com/sitemap.xml
دستورات اصلی
User-agent
مشخص میکند دستورات برای کدام ربات اعمال میشود. * به معنای تمام رباتها است.
Dishair
مسیرهایی که ربات اجازه خزش ندارد.
Allow
مسیرهایی که ربات اجازه خزش دارد (حتی اگر در Disallow بالاتر ذکر شده باشد).
Sitemap
آدرس فایل سایتمپ وبسایت.
نکات مهم
- فایل Robots.txt فقط یک پیشنهاد است و رباتهای مخرب ممکن است آن را رعایت نکنند
- Robots.txt مانع ایندکس شدن صفحات نمیشود (فقط خزش را محدود میکند)
- برای جلوگیری از ایندکس شدن از تگ meta robots noindex استفاده کنید
- فایل Robots.txt باید در ریشه دامنه قرار گیرد
- هرگز فایل Robots.txt را حذف نکنید
مثالهای رایج
# مسدود کردن دسترسی رباتها به پنل مدیریت
User-agent: *
Disallow: /admin/
# مسدود کردن فایلهای خاص
User-agent: *
Disallow: /private/
Disallow: /*.pdf$
# اجازه دسترسی به همه چیز
User-agent: *
Disallow:
مقالههای مرتبط
آماده شروع هستید؟
همین الان رایگان ثبتنام کنید و کسب و کار تلگرامی خود را متحول کنید.
شروع رایگان