Robots.txt là một tệp văn bản thuần đặt tại thư mục gốc của website (ví dụ: tenmien.com/robots.txt) chứa các chỉ dẫn cho bot của công cụ tìm kiếm và AI biết được phép hoặc không được phép thu thập dữ liệu ở những khu vực nào của website. Đây là tệp đầu tiên mọi bot đọc trước khi crawl một site, hoạt động theo giao thức REP (Robots Exclusion Protocol) tồn tại từ năm 1994. Cần hiểu đúng bản chất: robots.txt chỉ chặn thu thập (crawl), không chặn lập chỉ mục (index) — muốn ngăn một trang xuất hiện trên Google phải dùng thẻ meta noindex. Năm 2026, robots.txt gánh thêm vai trò mới quyết định với GEO: đây là nơi cho phép hoặc từ chối các AI bot như GPTBot, ClaudeBot, PerplexityBot — chặn bot nào đồng nghĩa website biến mất khỏi nền tảng AI đó.
Robots.txt là gì? Nguồn gốc và cách hoạt động
Robots.txt ra đời năm 1994 theo giao thức Robots Exclusion Protocol (REP) — quy ước chung của cộng đồng web nhằm giúp chủ site “nói chuyện” với các chương trình thu thập tự động. Đến 2019, Google đề xuất chuẩn hóa REP thành tiêu chuẩn internet chính thức (RFC 9309, hoàn tất năm 2022), biến quy ước gần 30 năm tuổi thành chuẩn có tài liệu rõ ràng.

Cơ chế hoạt động gồm ba bước:
- Bot ghé site, đọc robots.txt trước tiên: Trước khi thu thập bất kỳ trang nào, bot tải tệp tenmien.com/robots.txt để biết “nội quy”.
- Đối chiếu quy tắc theo tên bot: Tệp chia thành các nhóm quy tắc theo
User-agent(tên bot) — bot tìm nhóm dành cho mình, không có thì áp dụng nhóm chung (User-agent: *). - Tuân thủ tự nguyện: REP là quy ước danh dự — bot “tử tế” (Googlebot, Bingbot, GPTBot, ClaudeBot) tuân thủ nghiêm; bot xấu (scraper, bot spam) hoàn toàn có thể phớt lờ. Vì vậy robots.txt là công cụ quản lý crawl, không phải công cụ bảo mật — dữ liệu nhạy cảm phải bảo vệ bằng mật khẩu, không phải bằng Disallow.
Điểm gây hiểu nhầm nhiều nhất: Disallow không xóa trang khỏi Google. Trang bị chặn crawl vẫn có thể được index (hiển thị không mô tả) nếu có link trỏ đến từ nơi khác. Muốn loại trang khỏi kết quả tìm kiếm: dùng thẻ meta noindex và không chặn crawl trang đó — vì bot phải đọc được trang mới thấy thẻ noindex. Chặn crawl một trang đã noindex là tự vô hiệu hóa chính lệnh noindex của mình.
Cú pháp robots.txt — 5 lệnh cần biết
| Lệnh | Chức năng | Ví dụ |
|---|---|---|
User-agent | Khai báo nhóm quy tắc áp dụng cho bot nào | User-agent: Googlebot / User-agent: * (mọi bot) |
Disallow | Cấm thu thập đường dẫn | Disallow: /wp-admin/ |
Allow | Mở ngoại lệ trong khu vực bị cấm | Allow: /wp-admin/admin-ajax.php |
Sitemap | Khai vị trí sơ đồ trang | Sitemap: https://tenmien.com/sitemap_index.xml |
Crawl-delay | Giãn tốc độ thu thập (Google bỏ qua, một số bot khác tôn trọng) | Crawl-delay: 10 |
Bốn quy tắc cú pháp quan trọng:
- Phân biệt hoa thường ở đường dẫn:
/Blog/và/blog/là hai đường dẫn khác nhau; tên lệnh thì không phân biệt. - Ký tự đại diện:
*khớp mọi chuỗi ký tự,$đánh dấu kết thúc URL —Disallow: /*?orderby=chặn mọi URL chứa tham số sắp xếp;Disallow: /*.pdf$chặn mọi tệp PDF. - Dòng trống ngăn cách các nhóm User-agent: Mỗi nhóm gồm một hoặc nhiều dòng User-agent liền nhau kèm các quy tắc của nhóm.
- Quy tắc cụ thể hơn thắng: Khi Allow và Disallow xung đột, đường dẫn khai chi tiết hơn (dài hơn) được ưu tiên.
Mẫu robots.txt chuẩn cho WordPress/WooCommerce 2026
Mẫu đầy đủ vừa chuẩn SEO vừa mở cửa AI search:
# ===== AI Bots - Cho phép thu thập (phục vụ GEO) =====
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: Google-Extended
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: Applebot-Extended
Allow: /
User-agent: Meta-ExternalAgent
Allow: /
# ===== Quy tắc chung cho mọi bot =====
User-agent: *
Allow: /
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Disallow: /gio-hang/
Disallow: /thanh-toan/
Disallow: /tai-khoan/
Disallow: /?s=
Disallow: /*?orderby=
Disallow: /*?filter_
Disallow: /*?add-to-cart=
# ===== Sitemap =====
Sitemap: https://tenmien.com/sitemap_index.xmlGiải thích logic từng khối:
- Khối AI bot: Khai riêng từng bot với
Allow: /để chắc chắn chúng được vào toàn site — nền tảng của chiến lược GEO (chi tiết ở mục dưới). - Chặn wp-admin nhưng mở admin-ajax.php: Khu quản trị không cần crawl, nhưng admin-ajax.php phục vụ nhiều tính năng hiển thị phía người dùng — chặn nhầm gây lỗi render.
- Chặn trang giỏ hàng/thanh toán/tài khoản: Trang chức năng WooCommerce không có giá trị tìm kiếm — đổi slug theo site thực tế (
/cart/,/checkout/,/my-account/nếu dùng mặc định tiếng Anh). - Chặn URL tham số: Trang kết quả tìm kiếm nội bộ (
?s=), sắp xếp, lọc và thêm giỏ hàng sinh URL vô tận — chặn để tiết kiệm ngân sách crawl (crawl budget), giúp bot dồn tài nguyên vào trang giá trị. - Sitemap cuối tệp: Khai chính chủ để mọi bot tìm thấy bản đồ site ngay lần đọc đầu.
Lưu ý triển khai trên WordPress: Rank Math và Yoast cho sửa robots.txt ảo ngay trong giao diện — nhưng nếu đã tồn tại tệp vật lý ở thư mục gốc thì tệp vật lý thắng, plugin không ghi đè được; chọn một trong hai cách quản lý, tránh dùng song song.
Robots.txt với GEO — cánh cổng vào AI search
Từ 2023–2024, các công ty AI công bố bot thu thập riêng và robots.txt trở thành “công tắc” quyết định thương hiệu có mặt trên AI search hay không:
Danh sách AI bot quan trọng cần biết:
- GPTBot / OAI-SearchBot (OpenAI): GPTBot thu thập cho huấn luyện mô hình; OAI-SearchBot phục vụ ChatGPT Search trích dẫn nguồn — chặn OAI-SearchBot là mất hiện diện trên ChatGPT Search.
- ClaudeBot (Anthropic): Thu thập cho các mô hình Claude.
- Google-Extended (Google): Công tắc riêng cho Gemini và AI — chặn nó không ảnh hưởng thứ hạng Google truyền thống (Googlebot vẫn vào bình thường) nhưng ảnh hưởng hiện diện trong hệ sinh thái AI của Google.
- PerplexityBot: Phục vụ Perplexity — công cụ trả lời kèm trích dẫn đang tăng trưởng nhanh.
- Applebot-Extended, Meta-ExternalAgent: Công tắc AI của Apple và Meta.
- CCBot (Common Crawl): Kho dữ liệu mở nhiều mô hình dùng huấn luyện.
- Bytespider (ByteDance): Nổi tiếng crawl dày đặc tốn tài nguyên — có thể cân nhắc chặn riêng nếu server quá tải, vì giá trị mang lại tại thị trường Việt Nam thấp.
Logic quyết định cho chủ website: Với site bán hàng và site nội dung muốn được AI giới thiệu, mở toàn bộ AI bot là lựa chọn đúng — người dùng hỏi AI xong vẫn phải vào site để mua, nên “AI đọc nội dung miễn phí” thực chất là quảng cáo miễn phí. Chỉ các site kinh doanh chính nội dung (báo trả phí, dữ liệu độc quyền) mới cần cân nhắc chặn chọn lọc.
Bẫy kỹ thuật cần rà: Robots.txt mở nhưng tường lửa/CDN vẫn chặn — Cloudflare có nút “Block AI bots” một cú nhấp, nhiều plugin bảo mật chặn bot lạ theo mặc định; nhiều site bật từ các đợt “chống AI” 2023 rồi quên. Kiểm chứng bằng access log của server: thấy GPTBot, ClaudeBot thực sự tải trang thành công (mã 200) mới là mở thật.
Cách kiểm tra robots.txt đúng hay sai
- Mở trực tiếp trên trình duyệt: Truy cập tenmien.com/robots.txt — tệp phải hiển thị được (mã 200); lỗi 404 nghĩa là chưa có tệp (bot hiểu là được phép crawl tất cả), lỗi 5xx khiến Google tạm ngừng crawl toàn site.
- Trình kiểm tra của Google Search Console: Mục Cài đặt → robots.txt hiển thị phiên bản Google đang đọc, lịch sử tải và lỗi cú pháp từng dòng.
- Kiểm tra tác động lên URL cụ thể: Dùng công cụ URL Inspection trong Search Console dán URL bất kỳ — báo cáo cho biết URL có bị robots.txt chặn không.
- Đối chiếu báo cáo index: Search Console mục Page Indexing, hàng “Bị chặn bởi robots.txt” liệt kê mọi trang đang bị chặn — rà xem có trang quan trọng lọt vào danh sách không.
- Xem log server định kỳ: Xác nhận các bot mục tiêu (Googlebot lẫn AI bot) truy cập thành công với tần suất hợp lý.
Sai lầm robots.txt phổ biến cần tránh
Disallow: /quên gỡ sau khi làm site: Lệnh chặn toàn site dùng trong giai đoạn phát triển bị bỏ quên khi ra mắt — site nhiều tháng không được crawl; đây là tai nạn robots.txt kinh điển nhất.- Dùng robots.txt để chặn index: Nhầm lẫn cơ chế — chặn crawl không xóa trang khỏi Google, thậm chí vô hiệu hóa thẻ noindex vì bot không đọc được trang. Chặn index = meta noindex; robots.txt = quản lý crawl.
- Giấu trang nhạy cảm bằng Disallow: Robots.txt công khai cho mọi người đọc — liệt kê
/admin-bi-mat/trong đó chẳng khác chỉ đường cho kẻ xấu; bảo mật phải bằng xác thực, không bằng REP. - Chặn CSS/JavaScript: Chặn
/wp-includes/hay thư mục assets khiến Google render trang không đúng giao diện thật — đánh giá sai trải nghiệm, hại thứ hạng. - Chặn nhầm AI bot qua lớp khác: Robots.txt mở nhưng CDN/tường lửa chặn — mất hiện diện AI search trong im lặng, chỉ phát hiện được qua log.
- Cú pháp sai âm thầm: Thiếu dấu
/đầu đường dẫn, gõ nhầm tên bot, đặt Sitemap sai URL — tệp vẫn “chạy” nhưng sai ý định; luôn kiểm tra lại bằng công cụ của Search Console sau mỗi lần sửa.
Câu hỏi thường gặp về robots.txt (FAQ)
Website không có robots.txt có sao không? Không lỗi — bot hiểu là được phép thu thập toàn bộ và site vẫn index bình thường. Tuy nhiên nên có tệp để: khai báo sitemap, chặn khu vực lãng phí ngân sách crawl (trang quản trị, URL tham số) và chủ động khai chính sách với AI bot.
Robots.txt có chặn được trang khỏi Google không? Không — robots.txt chỉ chặn thu thập; trang bị chặn vẫn có thể xuất hiện trên Google (không mô tả) nếu có liên kết trỏ đến. Muốn loại trang khỏi kết quả: dùng thẻ meta noindex và để bot đọc được trang đó — hai cơ chế này thường bị dùng nhầm cho nhau.
Nên cho phép hay chặn AI bot như GPTBot, ClaudeBot? Với site bán hàng và site muốn được AI giới thiệu: nên cho phép — đây là điều kiện xuất hiện trên ChatGPT, Perplexity, AI Overviews, và người dùng vẫn phải vào site để mua hàng. Chỉ site kinh doanh chính bằng nội dung độc quyền mới cần cân nhắc chặn chọn lọc; riêng bot crawl hung hãn ít giá trị (như Bytespider) có thể chặn để tiết kiệm tài nguyên.
Robots.txt đặt ở đâu, tạo bằng cách nào? Bắt buộc ở thư mục gốc tên miền: tenmien.com/robots.txt — đặt trong thư mục con không có tác dụng. Trên WordPress: sửa qua Rank Math/Yoast (robots.txt ảo) hoặc tạo tệp vật lý qua trình quản lý file của hosting; nhớ rằng tệp vật lý ghi đè bản ảo của plugin.
Crawl-delay có nên dùng không? Googlebot bỏ qua Crawl-delay (điều tốc trong Search Console); một số bot khác tôn trọng. Chỉ nên dùng khi server thực sự quá tải vì bot cụ thể — đặt cho riêng bot đó thay vì cho *, tránh vô tình làm chậm thu thập của các bot quan trọng.
Robots.txt của website xem ở đâu, có bí mật không? Hoàn toàn công khai — gõ tenmien.com/robots.txt của bất kỳ site nào cũng xem được, kể cả của đối thủ. Đây vừa là mẹo học hỏi (tham khảo cấu hình các site lớn cùng ngành) vừa là lời nhắc: đừng bao giờ ghi thông tin nhạy cảm vào tệp này.
