Kiểm tra robots.txt
Dán robots.txt và một URL để biết quy tắc nào thực sự quyết định — khớp dài nhất, không phải khớp đầu tiên.
Chạy hoàn toàn trong trình duyệt của bạn
Đang tải công cụ...
Cách sử dụng
- Dán robots.txt đúng như nó đang được phục vụ.
- Nhập URL bạn đang thắc mắc — đầy đủ hoặc chỉ phần đường dẫn.
- Chọn trình thu thập; nhóm ký tự đại diện chỉ dùng khi không nhóm cụ thể nào khớp.
- Đọc xem quy tắc nào quyết định và nằm ở dòng nào.
Tính năng
- Ưu tiên khớp dài nhất, Allow thắng khi hòa, đúng cách các trình thu thập triển khai.
- Hỗ trợ ký tự đại diện `*` và `$`, áp lên cả đường dẫn lẫn query.
- Chọn nhóm theo user-agent cụ thể nhất — nhóm riêng che hoàn toàn nhóm đại diện.
- Nêu rõ quy tắc quyết định và số dòng của nó.
- Chạy hoàn toàn trong trình duyệt; không tải gì về.
Câu hỏi thường gặp
- Vì sao Disallow của tôi không chặn được gì?
- Thường là vì có một Allow dài hơn cũng khớp URL đó. `Disallow: /blog` đi cùng `Allow: /blog/public` sẽ để mọi thứ dưới /blog/public vẫn thu thập được, vì đường dẫn dài hơn thắng — bất kể dòng nào viết trước. Nguyên nhân phổ biến còn lại là nhóm riêng: một trình thu thập có khối `User-agent:` của riêng nó sẽ không đọc các quy tắc đại diện.
- robots.txt có giữ trang khỏi kết quả tìm kiếm không?
- Không. Nó chỉ đề nghị các trình thu thập tử tế đừng tải trang. URL bị chặn vẫn có thể được lập chỉ mục qua liên kết từ nơi khác và xuất hiện mà không có mô tả — và vì trình thu thập không tải được trang, thẻ `noindex` trên chính trang đó không bao giờ được nhìn thấy. Muốn giữ ngoài chỉ mục, hãy cho phép thu thập và dùng `noindex`, hoặc yêu cầu đăng nhập.
- Mọi trình thu thập đều tuân thủ chứ?
- Các công cụ tìm kiếm lớn thì có. Trình cào dữ liệu và nhiều trình thu thập AI thì không, và không có cơ chế nào ép được — robots.txt là một lời đề nghị, không phải kiểm soát truy cập. Thứ gì nhất định không được đọc thì phải có xác thực.
Công cụ liên quan
Tạo file robots.txt và xem trước nó thực sự làm gì trước khi bạn tải lên.
Biến danh sách URL thành sitemap.xml hợp lệ — escape dấu &, và chỉ rõ link khác tên miền.
Tách một URL thành giao thức, tên miền, đường dẫn, tham số truy vấn và mảnh neo.