Noindex là chỉ thị trong thẻ meta robots (<meta name="robots" content="noindex">) báo cho công cụ tìm kiếm không đưa trang đó vào chỉ mục, nghĩa là trang sẽ không xuất hiện trên kết quả tìm kiếm. Đây là công cụ duy nhất loại bỏ một trang khỏi Google một cách đáng tin cậy — robots.txt chỉ chặn thu thập chứ không chặn lập chỉ mục, và canonical chỉ gom tín hiệu chứ không xóa trang. Điều kiện bắt buộc để noindex hoạt động: bot phải crawl được trang mới đọc được thẻ, nên tuyệt đối không được chặn trang đó trong robots.txt. Sử dụng noindex đúng chỗ giúp website loại bỏ hàng trăm trang mỏng không giá trị, tập trung ngân sách crawl và nâng chất lượng tổng thể của site trong mắt cả Google lẫn các hệ thống AI — vốn cũng đánh giá site theo mặt bằng chung chứ không chỉ theo từng trang.
Noindex là gì? Cú pháp và cách hoạt động
Noindex được khai bằng thẻ meta đặt trong phần head của trang:
<meta name="robots" content="noindex">Khi Googlebot thu thập trang và đọc thấy chỉ thị này, nó loại trang khỏi chỉ mục (hoặc không thêm vào nếu chưa có). Trang vẫn tồn tại, người dùng vẫn truy cập bình thường qua liên kết trực tiếp — chỉ là không xuất hiện trên kết quả tìm kiếm.
Các biến thể thường gặp:
| Khai báo | Ý nghĩa |
|---|---|
noindex | Không index trang, vẫn đi theo các liên kết trên trang |
noindex, nofollow | Không index và không đi theo liên kết trên trang |
noindex, follow | Không index nhưng vẫn đi theo liên kết — từng phổ biến, nay ít giá trị vì Google có thể ngừng theo liên kết ở trang noindex lâu ngày |
index, follow | Mặc định, không cần khai |
googlebot: noindex | Chỉ áp dụng với Googlebot, các bot khác không bị ảnh hưởng |
Cách khai qua HTTP header (dùng cho tệp không phải HTML như PDF, ảnh):
X-Robots-Tag: noindexCơ chế quan trọng nhất phải nhớ: noindex chỉ có tác dụng khi bot đọc được thẻ. Nếu bạn vừa đặt noindex vừa chặn URL đó trong robots.txt, bot không vào được trang, không thấy thẻ, và trang có thể tiếp tục nằm trong chỉ mục (hiển thị dạng không có mô tả). Đây là lỗi phổ biến nhất liên quan noindex.
Noindex, robots.txt và canonical — phân biệt ba công cụ
| Tiêu chí | meta noindex | robots.txt Disallow | rel=”canonical” |
|---|---|---|---|
| Mục đích | Loại trang khỏi kết quả tìm kiếm | Chặn bot thu thập | Khai URL chính giữa các bản trùng |
| Bot có crawl trang? | Có (bắt buộc để đọc thẻ) | Không | Có |
| Trang có bị index? | Không | Có thể vẫn index (không mô tả) | Bản canonical được index |
| Tín hiệu có được gom? | Không | Không | Có — gom về URL canonical |
| Dùng khi | Trang không muốn ai tìm thấy qua Google | Tiết kiệm ngân sách crawl khu vực vô giá trị | Nội dung trùng cần gom sức mạnh |
Chọn công cụ theo tình huống:
- Muốn trang biến mất khỏi Google → noindex (và đảm bảo không chặn robots.txt)
- Muốn bot đừng tốn công vào khu vực rác (URL lọc tham số vô tận, thư mục quản trị) → robots.txt
- Có nhiều URL cùng nội dung cần gom sức mạnh → canonical
- Trang đã chuyển hẳn sang địa chỉ mới → chuyển hướng 301
Ba lỗi kết hợp sai cần tránh: noindex + chặn robots.txt (thẻ vô hiệu); noindex + canonical trỏ vào trang đó (tín hiệu mâu thuẫn); noindex trang đang có traffic tốt (mất trắng nguồn khách).
Trang nào nên đặt noindex?
Nhóm nên noindex gần như luôn đúng:
- Trang kết quả tìm kiếm nội bộ (
/?s=): Nội dung động, trùng lặp, không giá trị với người tìm từ Google — Google cũng khuyến nghị không index loại trang này. - Trang giỏ hàng, thanh toán, tài khoản (WooCommerce): Trang chức năng, nội dung thay đổi theo người dùng.
- Trang cảm ơn, xác nhận đơn hàng: Chỉ có nghĩa sau một hành động cụ thể.
- Trang đính kèm media (attachment page): WordPress sinh một trang riêng cho mỗi ảnh tải lên — hàng trăm trang rỗng nếu không xử lý; plugin SEO thường có tùy chọn chuyển hướng hoặc noindex.
- Trang lưu trữ tác giả khi site chỉ có một tác giả: Trùng hoàn toàn với trang blog.
- Trang phiên bản in, trang xem trước: Bản sao nội dung.
- Landing page quảng cáo dùng riêng cho chiến dịch: Không muốn lẫn vào kết quả tự nhiên.
Nhóm cần cân nhắc theo từng site:
- Tag mỏng: Tag chỉ có 1–3 bài, không có mô tả riêng thì nên noindex; tag đã xây thành trang chủ đề có nội dung và traffic thì giữ index.
- Trang phân trang: Thực hành hiện nay là để index với self-canonical, không noindex — noindex hàng loạt trang phân trang khiến sản phẩm/bài từ trang 2 trở đi khó được phát hiện.
- Danh mục sản phẩm: Luôn nên index nếu có nội dung mô tả — đây thường là trang chuyển đổi tốt nhất của site thương mại điện tử.
- Nội dung mỏng chưa hoàn thiện: Noindex tạm là giải pháp ngắn hạn; giải pháp đúng là nâng chất hoặc gộp bài.
Tuyệt đối không noindex: trang chủ, trang danh mục chính, bài viết chủ lực, trang dịch vụ/sản phẩm — nghe hiển nhiên nhưng đây chính là các tai nạn cấu hình gây sụt traffic nghiêm trọng nhất trong thực tế.
Cách đặt noindex trên WordPress
Cách 1 — Rank Math (từng trang): Mở bài viết/trang → hộp Rank Math → tab Advanced → mục Robots Meta → tick No Index. Có thể kết hợp các tùy chọn khác như No Follow, No Archive.
Cách 2 — Rank Math (toàn bộ một loại nội dung): Rank Math SEO → Titles & Meta → chọn loại nội dung (Posts, Pages, Products, Categories, Tags, Author) → tắt “Show in search results” — mọi trang thuộc loại đó tự động noindex và bị loại khỏi sitemap.
Cách 3 — Yoast SEO: Từng trang: tab Advanced → “Allow search engines to show this page?” → chọn No. Toàn site: SEO → Cài đặt → từng loại nội dung có công tắc tương tự.
Cách 4 — X-Robots-Tag cho tệp không phải HTML: Với PDF, ảnh cần loại khỏi index, thêm quy tắc trong cấu hình máy chủ (Nginx/OpenLiteSpeed/Apache) hoặc qua plugin hỗ trợ header.
Kiểm tra kết quả: Dùng công cụ Kiểm tra URL trong Google Search Console — báo cáo cho biết trang có bị loại vì “Trang có thẻ noindex” hay không. Hoặc xem nguồn trang tìm chuỗi noindex.
Lưu ý về thời gian: Trang đã index cần Google crawl lại mới nhận thẻ noindex và gỡ khỏi kết quả — thường vài ngày đến vài tuần. Muốn gỡ gấp, dùng công cụ Xóa URL tạm thời trong Search Console (hiệu lực khoảng 6 tháng) song song với việc đặt noindex vĩnh viễn.
Noindex với GEO — ảnh hưởng đến AI thế nào?
Đây là góc ít được bàn nhưng cần hiểu đúng để không xử lý sai:
1. Noindex là chỉ thị dành cho công cụ tìm kiếm, không phải cho AI crawler: Thẻ meta robots noindex được thiết kế cho hệ thống lập chỉ mục của search engine. Các AI crawler như GPTBot, ClaudeBot, PerplexityBot có cơ chế tuân thủ riêng, chủ yếu dựa trên robots.txt và chính sách của từng nền tảng — noindex không phải công cụ kiểm soát AI. Muốn ngăn AI thu thập một khu vực, phải dùng robots.txt với user-agent tương ứng.
2. Với AI Overviews thì noindex có tác dụng gián tiếp: Vì AI Overviews truy xuất nguồn từ chính chỉ mục Google, trang đã noindex sẽ không nằm trong chỉ mục và do đó không được chọn làm nguồn trích dẫn. Đây là điểm cần cân nhắc: noindex một trang đồng nghĩa từ bỏ luôn cơ hội trang đó xuất hiện trong khối AI của Google.
3. Dọn nội dung mỏng nâng chất lượng site trong mắt AI: Cả Google lẫn các hệ thống AI đều đánh giá website ở cấp độ tổng thể, không chỉ từng trang. Hàng trăm tag rỗng, trang đính kèm, trang kết quả tìm kiếm nội bộ nằm trong chỉ mục kéo mặt bằng chất lượng site xuống. Noindex nhóm này là việc dọn dẹp phục vụ cả SEO lẫn GEO.
4. Tránh nhầm lẫn tai hại: Một số chủ site muốn “chặn AI dùng nội dung” đã đặt noindex hàng loạt — kết quả là mất thứ hạng Google (và mất luôn cơ hội vào AI Overviews) trong khi các AI crawler khác vẫn thu thập bình thường vì chúng không đọc thẻ này như một lệnh cấm. Công cụ đúng cho mục đích đó là robots.txt khai theo từng bot.
Lỗi noindex thường gặp và cách khắc phục
- Quên gỡ noindex sau khi làm site: WordPress có tùy chọn “Không cho công cụ tìm kiếm lập chỉ mục” (Cài đặt → Đọc) dùng khi phát triển — quên bỏ tick khi ra mắt khiến site không bao giờ được index. Đây là tai nạn kinh điển nhất; kiểm tra ngay khi site mới không có dữ liệu trong Search Console.
- Noindex + chặn robots.txt: Bot không đọc được thẻ, trang vẫn ở trong chỉ mục — gỡ chặn robots.txt để bot vào đọc noindex, sau khi trang đã bị gỡ khỏi index mới cân nhắc chặn.
- Noindex nhầm trang có traffic: Thao tác hàng loạt theo loại nội dung mà không kiểm tra dữ liệu — luôn đối chiếu Search Console trước khi noindex cả một nhóm trang.
- Noindex nhưng vẫn để trong sitemap: Tín hiệu mâu thuẫn — trang noindex phải bị loại khỏi sitemap; plugin SEO thường tự đồng bộ khi bạn tắt qua giao diện của plugin.
- Dùng noindex thay cho canonical: Nội dung trùng cần gom sức mạnh thì noindex làm mất luôn giá trị của bản bị loại; canonical mới là công cụ đúng.
- Kỳ vọng gỡ khỏi Google ngay lập tức: Cần chờ Google crawl lại; dùng công cụ Xóa URL tạm thời nếu gấp.
Câu hỏi thường gặp về noindex (FAQ)
Noindex và robots.txt khác nhau thế nào? Noindex loại trang khỏi kết quả tìm kiếm nhưng bot vẫn phải crawl được để đọc thẻ; robots.txt chặn bot thu thập nhưng trang vẫn có thể bị index (hiển thị không mô tả) nếu có liên kết trỏ tới. Muốn trang biến mất khỏi Google phải dùng noindex và không chặn crawl trang đó.
Trang noindex có nhận và truyền link equity không? Trang noindex vẫn nhận liên kết nhưng không xuất hiện trên kết quả tìm kiếm. Với chỉ thị “noindex, follow”, ban đầu bot vẫn đi theo liên kết trên trang, tuy nhiên Google có xu hướng giảm dần việc theo liên kết ở các trang noindex lâu ngày — nên không nên coi trang noindex là kênh phân phối sức mạnh nội bộ.
Bao lâu trang bị gỡ khỏi Google sau khi đặt noindex? Thường vài ngày đến vài tuần, tùy tần suất Google quay lại crawl trang đó. Muốn nhanh hơn, dùng công cụ Kiểm tra URL yêu cầu lập chỉ mục lại (để Google đọc thẻ mới) hoặc công cụ Xóa URL tạm thời trong Search Console.
Có nên noindex trang tag và trang phân trang không? Tag mỏng chỉ vài bài, không có nội dung riêng thì nên noindex và loại khỏi sitemap. Trang phân trang thì không nên noindex — thực hành hiện nay là để index với self-canonical, vì noindex khiến nội dung từ trang 2 trở đi khó được phát hiện và index.
Noindex có ngăn được AI như ChatGPT thu thập nội dung không? Không đáng tin cậy — noindex là chỉ thị cho hệ thống lập chỉ mục của công cụ tìm kiếm, còn AI crawler tuân theo robots.txt và chính sách riêng của từng nền tảng. Muốn kiểm soát việc AI thu thập, phải khai trong robots.txt theo từng user-agent như GPTBot, ClaudeBot, PerplexityBot.
Website không index được, có phải do noindex không? Đây là nguyên nhân cần kiểm tra đầu tiên: vào Cài đặt → Đọc trong WordPress xem tùy chọn chặn công cụ tìm kiếm có đang bật không, rồi xem nguồn trang tìm chuỗi noindex và dùng công cụ Kiểm tra URL trong Search Console để biết lý do chính xác Google đưa ra.
