ساخت robots.txt
فایل robots.txt سایت را با مسیرهای مجاز و ممنوع بسازید.
User-agent: * Disallow: /admin Disallow: /cart Allow: / Sitemap: https://example.com/sitemap.xml
درباره ساخت robots.txt
فایل robots.txt نخستین فایلی است که رباتهای موتور جستجو پیش از خزیدن در سایت شما میخوانند و مشخص میکند کدام بخشها قابل خزش هستند و کدام بخشها نباید بررسی شوند. نوشتن دستی این فایل با نحو خاص خودش، مثل User-agent، Disallow و Allow، برای خیلی از کاربران گیجکننده است و یک اشتباه کوچک میتواند کل سایت را از دید گوگل پنهان کند. ابزار ساخت robots.txt ابزاریو با چند انتخاب ساده—مانند اجازه کلی ایندکس یا بستن کامل سایت، فهرست مسیرهای ممنوع و آدرس نقشه سایت—فایلی استاندارد و آماده تولید میکند. کافی است خروجی را در یک فایل متنی به نام robots.txt ذخیره کرده و در ریشه دامنه آپلود کنید. این ابزار مخصوصاً برای مدیران سایتهایی که میخواهند مسیرهای مدیریتی، سبد خرید یا صفحات آزمایشی را از خزش رباتها دور نگه دارند، و در عین حال آدرس نقشه سایت را بهدرستی معرفی کنند، کاربردی است.
راهنمای استفاده
- 1سیاست کلی سایت را انتخاب کنید.
- 2مسیرهای ممنوع را خطبهخط بنویسید.
- 3خروجی را در فایل robots.txt ریشه سایت بگذارید.
چرا از این ابزار استفاده کنیم؟
- ساخت سریع فایل robots.txt استاندارد بدون نیاز به یادگیری نحو دستی
- امکان انتخاب بین اجازه کلی ایندکس با استثناها یا بستن کامل سایت
- افزودن چند مسیر Disallow بهصورت همزمان با وارد کردن هر خط
- درج خودکار آدرس Sitemap در انتهای فایل برای معرفی نقشه سایت به رباتها
- پشتیبانی از تنظیم Crawl-delay برای کنترل سرعت خزش در سرورهای کمظرفیت
- خروجی آماده کپی که مستقیماً در ریشه دامنه قابل استفاده است
مثالهای کاربردی
بستن پنل مدیریت
با نوشتن /admin و /wp-admin در فهرست مسیرهای ممنوع، خروجی خطوطی مانند «Disallow: /admin» و «Disallow: /wp-admin» تولید میکند تا رباتها وارد پنل مدیریت نشوند.
معرفی آدرس نقشه سایت
با وارد کردن https://example.com/sitemap.xml در فیلد مربوطه، خط «Sitemap: https://example.com/sitemap.xml» به انتهای فایل اضافه میشود تا گوگل سریعتر همه صفحات را پیدا کند.
بستن کامل سایت برای رباتها
برای یک سایت در حال توسعه که هنوز نباید ایندکس شود، انتخاب گزینه «بستن کل سایت» خروجی «User-agent: *» و «Disallow: /» را میسازد که کل دامنه را از دسترس رباتها خارج میکند.
اجازه ایندکس با چند استثنا
برای یک فروشگاه که میخواهد صفحات محصول ایندکس شوند اما سبد خرید و پرداخت خیر، فهرست /cart و /checkout در کنار Allow: / باعث میشود فقط همان دو مسیر مسدود شوند.
پرسشهای متداول
robots.txt کجا قرار میگیرد؟
در ریشه دامنه، یعنی آدرس example.com/robots.txt
آیا Disallow جلوی ایندکس را میگیرد؟
همیشه نه؛ برای جلوگیری قطعی از ایندکس از متا تگ noindex استفاده کنید.
اگر فایل robots.txt نداشته باشم چه اتفاقی میافتد؟
در نبود این فایل، رباتها معمولاً کل سایت را قابل خزش در نظر میگیرند؛ نبود فایل بهخودیخود مشکلی ایجاد نمیکند اما فرصت کنترل دقیق خزش را از شما میگیرد.
آیا میتوانم برای رباتهای مختلف قوانین جدا بنویسم؟
بله، با تعریف چند بلوک User-agent جداگانه—مثلاً یکی برای Googlebot و یکی برای بقیه رباتها—میتوانید قوانین متفاوتی تنظیم کنید؛ این ابزار خروجی پایه با یک قانون عمومی برای همه رباتها میسازد.
چرا صفحهای که در robots.txt بستهام باز هم در گوگل دیده میشود؟
دستور Disallow فقط جلوی خزش را میگیرد، نه ایندکس شدن؛ اگر لینکهایی از جای دیگر به آن صفحه اشاره کنند، گوگل ممکن است آدرس را بدون محتوا نمایش دهد. برای جلوگیری قطعی باید از متا تگ noindex استفاده کرد.
Crawl-delay چه کاربردی دارد؟
این دستور به رباتها میگوید چند ثانیه بین هر درخواست صبر کنند تا فشار روی سرور کم شود؛ برای سایتهای پرترافیک با منابع محدود مفید است، هرچند گوگل به آن توجه نمیکند.