
Robots.txt là tệp văn bản ở gốc website dùng để hướng dẫn các bot tìm kiếm nên crawl những phần nào và nên tránh những phần nào; với website WordPress, cấu hình đúng robots.txt giúp bạn tiết kiệm crawl budget và ưu tiên thu thập dữ liệu cho trang quan trọng.
- Robots.txt không phải công cụ xóa khỏi Google, mà là file điều hướng bot.
- Nên chặn khu vực hệ thống, trang rác và URL tạo giá trị thấp.
- Không dùng robots.txt thay cho noindex khi bạn muốn ẩn một URL khỏi chỉ mục.
- Trong WordPress, robots.txt chuẩn cần đi cùng sitemap, canonical và cấu trúc site sạch.

Robots.txt là gì và nó hoạt động ra sao?
Hiểu đơn giản, robots.txt là một “bảng chỉ dẫn” đặt tại đường dẫn /robots.txt của website. Khi bot của Google, Bing hay các công cụ khác truy cập site, chúng thường đọc file này trước để biết đường nào nên đi tiếp và đường nào nên tránh. Vì vậy, nếu bạn quản lý một site lớn, một site WordPress nhiều plugin hoặc một hệ thống có nhiều URL lọc, robots.txt là lớp kiểm soát rất quan trọng.
Tuy nhiên, robots.txt chỉ là tín hiệu crawl. Nó không tự động làm một URL biến mất khỏi kết quả tìm kiếm nếu URL đó đã được phát hiện ở nơi khác. Đó là lý do khi bạn cần kiểm soát index, bạn phải phối hợp với canonical, noindex hoặc redirect, thay vì chỉ sửa robots.txt rồi chờ phép màu.
Nếu bạn muốn hiểu nền tảng kỹ thuật SEO rộng hơn, hãy xem thêm bài Technical SEO để nắm được bức tranh tổng thể, và bài SEO Audit để biết robots.txt chỉ là một phần trong checklist.
Khi nào nên dùng robots.txt?
Robots.txt phù hợp nhất trong các tình huống sau: chặn khu vực quản trị hoặc trang nội bộ không cần index, giảm crawl vào trang lọc tạo ra quá nhiều URL rác, hạn chế bot đâm vào khu vực thử nghiệm, và ưu tiên ngân sách crawl cho các trang đích có giá trị kinh doanh.
Ví dụ, nếu website thương mại điện tử tạo ra hàng nghìn URL từ bộ lọc màu sắc, kích thước hoặc sắp xếp, bot có thể tốn rất nhiều lượt crawl vào các biến thể gần như giống nhau. Khi đó, việc dùng robots.txt đúng cách, kết hợp canonical và xử lý tham số URL, sẽ tốt hơn nhiều so với việc để bot tự do bơi trong mê cung URL.
Những directive quan trọng trong robots.txt
Robots.txt thường chỉ cần vài dòng đơn giản nhưng phải dùng đúng ngữ cảnh. Các chỉ thị phổ biến nhất gồm User-agent để xác định bot, Disallow để chặn, Allow để mở quyền trong một vùng đã bị chặn, và Sitemap để khai báo sơ đồ trang web.
User-agent: *áp dụng cho mọi bot.Disallow: /wp-admin/chặn khu vực quản trị.Allow: /wp-admin/admin-ajax.phpcho phép một tệp cần thiết nếu site cần.Sitemap: https://atmarketing.vn/sitemap_index.xmlgiúp bot tìm sitemap nhanh hơn.
Với website lớn, nên kết hợp robots.txt cùng Crawl Budget để kiểm soát ngân sách crawl, và thêm sitemap trong bài hướng dẫn tạo sitemap XML nhằm hỗ trợ bot ưu tiên URL quan trọng.
Cách viết robots.txt chuẩn SEO cho WordPress
Một robots.txt chuẩn SEO cho WordPress không cần dài. Điều quan trọng là nó phải sạch, dễ đọc và chỉ chặn đúng phần cần chặn. Nếu bạn chặn quá tay, bot có thể không nhìn thấy tài nguyên quan trọng hoặc các trang công khai cần được index.
Mẫu cơ bản an toàn thường trông như sau:
User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://atmarketing.vn/sitemap_index.xmlNếu website có trang tìm kiếm nội bộ, trang thẻ tự động, hoặc các URL lọc sinh ra quá nhiều biến thể, bạn có thể cân nhắc chặn chúng bằng quy tắc rõ ràng. Nhưng trước khi chặn, hãy xác định xem URL đó có đang mang traffic hay không. Chặn quá sớm có thể làm mất cơ hội index của các trang hữu ích.
Nếu bạn đang làm WordPress SEO chuyên sâu, bài Canonical tag sẽ rất hữu ích khi website có nhiều phiên bản URL tương tự. Với các URL đã phát hiện nhưng chưa cần index, bạn có thể xem thêm IndexNow để hiểu cách thông báo URL mới nhanh hơn cho công cụ tìm kiếm.
Robots.txt, noindex và canonical: đừng nhầm vai trò
Đây là ba khái niệm rất dễ bị dùng sai. Robots.txt nói với bot rằng “đừng crawl khu vực này”. Noindex nói rằng “đừng đưa trang này vào chỉ mục”. Canonical nói rằng “nếu có nhiều phiên bản tương tự, hãy ưu tiên phiên bản này”. Ba công cụ khác nhau, mục tiêu khác nhau, và nên dùng đúng việc.
Ví dụ: nếu một trang có giá trị thấp nhưng vẫn cần bot truy cập để hiểu liên kết nội bộ, bạn không nên chặn bằng robots.txt. Thay vào đó, dùng noindex sẽ an toàn hơn. Ngược lại, nếu một khu vực hệ thống không phục vụ người dùng, robots.txt lại là lựa chọn hợp lý để giảm lãng phí crawl.
Những lỗi robots.txt phổ biến khiến SEO bị ảnh hưởng
- Chặn nhầm toàn bộ website bằng
Disallow: /. - Chặn thư mục chứa tài nguyên CSS/JS khiến bot không render đúng trang.
- Không khai báo sitemap, làm bot mất thời gian tìm URL quan trọng.
- Dùng robots.txt thay cho noindex, dẫn đến URL vẫn có thể xuất hiện trên SERP.
- Quên kiểm tra sau khi deploy, khiến staging rule bị đẩy sang production.
Một lỗi nữa rất hay gặp là cấu hình robots.txt theo mẫu copy-paste mà không đối chiếu với kiến trúc thực tế của site. Mỗi website có cấu trúc URL, plugin và luồng crawl khác nhau. Điều đúng với site A chưa chắc đúng với site B.
Checklist kiểm tra robots.txt trước khi xuất bản
- File có tồn tại ở đường dẫn
/robots.txtkhông? - Bot có đọc được sitemap chính xác không?
- Các thư mục hệ thống đã được chặn đúng chưa?
- Có vô tình chặn trang dịch vụ, bài viết hoặc danh mục quan trọng không?
- File có được cập nhật sau khi đổi cấu trúc website không?
Khi audit toàn site, hãy đặt robots.txt trong bức tranh lớn hơn cùng SEO Audit, Technical SEO và phân tích cấu trúc nội dung. Làm như vậy, bạn sẽ biết file này đang hỗ trợ hay đang cản trở khả năng crawl của site.
Kết luận
Robots.txt là một file nhỏ nhưng có tác động rất lớn tới cách bot tương tác với website. Dùng đúng, nó giúp bạn tiết kiệm crawl budget, giảm nhiễu và dẫn bot vào đúng khu vực cần ưu tiên. Dùng sai, nó có thể vô tình khóa mất những trang quan trọng hoặc làm website khó được hiểu hơn.
Nếu bạn quản lý website WordPress, hãy xem robots.txt như một phần của bộ công cụ kỹ thuật: kết hợp nó với sitemap, canonical, noindex, internal link và audit định kỳ. Khi đó, SEO không chỉ sạch hơn mà còn dễ mở rộng hơn theo hướng bền vững.
AT Việt Nam có thể hỗ trợ bạn rà soát robots.txt, sitemap, canonical, noindex và toàn bộ cấu trúc kỹ thuật SEO để website crawl gọn hơn, index đúng hơn và tăng trưởng ổn định hơn.
Liên hệ đội ngũ AT Việt Nam để nhận tư vấn và checklist tối ưu phù hợp với website của bạn.
Câu hỏi thường gặp về robots.txt
Robots.txt có chặn index không?
Không. Robots.txt chủ yếu hướng dẫn bot được phép hoặc không được phép crawl. Nếu bạn muốn một URL không xuất hiện trong chỉ mục, cách đúng hơn là dùng noindex hoặc xử lý canonical/redirect phù hợp.
WordPress nên chặn gì trong robots.txt?
Bạn nên ưu tiên chặn các đường dẫn hệ thống, trang tìm kiếm nội bộ, trang lọc rác hoặc các URL tạo ra giá trị thấp. Không nên chặn bừa các trang nội dung quan trọng chỉ vì muốn giảm crawl.
Robots.txt khác noindex như thế nào?
Robots.txt quyết định bot có được crawl hay không, còn noindex là tín hiệu yêu cầu không index một URL. Khi cần ẩn trang khỏi kết quả tìm kiếm, noindex thường là lựa chọn chính xác hơn.
Có nên chặn /wp-admin/ trong robots.txt không?
Có thể chặn một phần hệ thống như /wp-admin/ nhưng cần cẩn thận với các tài nguyên cần thiết cho giao diện quản trị hoặc các tệp CSS/JS nếu website của bạn phụ thuộc vào chúng để hiển thị đúng.

