Tạo file robots.txt
Tạo file robots.txt và xem trước nó thực sự làm gì trước khi bạn tải lên.
Chạy hoàn toàn trong trình duyệt của bạn
Đang tải công cụ...
Cách sử dụng
- Bắt đầu với nhóm *, áp dụng cho mọi trình thu thập.
- Thêm các đường dẫn cần chặn, mỗi dòng một đường dẫn, đều bắt đầu bằng /.
- Thêm sitemap dưới dạng URL đầy đủ.
- Dùng công cụ kiểm tra đường dẫn để xác nhận kết quả đúng như mong đợi, rồi sao chép hoặc tải file về đặt ở thư mục gốc.
Tính năng
- Nhóm quy tắc theo từng trình thu thập, có cho phép, chặn và độ trễ.
- Công cụ kiểm tra đường dẫn áp dụng đúng quy tắc thật: khớp dài nhất thắng, và Allow thắng Disallow khi bằng nhau.
- Cảnh báo trước khi bạn chặn toàn bộ website — sai lầm tốn kém nhất.
- Nhắc rằng đường dẫn liệt kê ở đây là công bố chứ không phải che giấu.
- Chạy trong trình duyệt; file là của bạn để tải về.
Câu hỏi thường gặp
- robots.txt có giấu được một trang không?
- Không. Nó chỉ đề nghị các trình thu thập tử tế đừng truy cập một đường dẫn, và bản thân nó là file công khai ở địa chỉ ai cũng đoán được — nên ghi /admin vào đó là nói cho tất cả mọi người, kể cả người bạn ít muốn nói nhất, biết /admin nằm ở đâu. Đây là file đầu tiên kẻ tấn công đọc. Hãy dùng xác thực cho thứ không được phép truy cập, và noindex cho thứ không được phép xuất hiện trong kết quả.
- robots.txt khác noindex thế nào?
- robots.txt ngăn trình thu thập tải trang; noindex ngăn trang xuất hiện trong kết quả. Hai thứ không thay thế nhau, và kết hợp cả hai lại phản tác dụng: một trang bị chặn trong robots.txt vẫn có thể được liệt kê nhờ liên kết từ nơi khác, và vì trình thu thập không được phép tải trang nên nó không bao giờ thấy thẻ noindex. Muốn gỡ một trang khỏi tìm kiếm, hãy cho phép thu thập và dùng noindex.
- Disallow: / có chặn tất cả không?
- Có — nó gỡ toàn bộ website khỏi kết quả tìm kiếm với mọi trình thu thập tuân thủ. Nó chỉ cách Disallow: /admin đúng vài ký tự, nên công cụ này nói thẳng thay vì lặng lẽ tạo ra.
- Vì sao Crawl-delay của tôi bị bỏ qua?
- Google đã ngừng hỗ trợ; tốc độ thu thập được đặt trong Search Console. Bing và Yandex vẫn tuân theo, nên vẫn nên giữ dòng này nếu bạn quan tâm tới hai công cụ đó.
Công cụ liên quan
Dán robots.txt và một URL để biết quy tắc nào thực sự quyết định — khớp dài nhất, không phải khớp đầu tiên.
Tạo thẻ meta SEO, Open Graph và Twitter.
Tạo URL chiến dịch có thể theo dõi.
Tách một URL thành giao thức, tên miền, đường dẫn, tham số truy vấn và mảnh neo.