SEO
Crawl Budget là gì? Website nào thực sự cần tối ưu
Nhiều chủ website nhỏ lo “Google không đủ ngân sách crawl” trong khi site chỉ có vài trăm trang. Phần lớn trường hợp, vấn đề thật nằm ở chỗ khác.
ScalioCập nhật 10 phút đọc

Crawl budget (ngân sách thu thập dữ liệu) là tập hợp các URL mà Googlebot có thể và muốn thu thập trên một website trong một khoảng thời gian. Google không có thời gian và tài nguyên vô hạn để đọc mọi URL trên mọi website, nên với mỗi site, hệ thống phải cân nhắc đọc bao nhiêu, đọc trang nào trước, và bao lâu quay lại một lần.

Điều quan trọng nhất cần nói ngay: theo hướng dẫn quản lý crawl budget cho site lớn của Google, đây chủ yếu là mối quan tâm của website rất lớn hoặc nội dung thay đổi rất nhanh. Google lấy ví dụ các site có khoảng một triệu trang trở lên thay đổi hằng tuần, hoặc khoảng mười nghìn trang trở lên thay đổi hằng ngày, hoặc site có phần lớn URL nằm ở trạng thái đã phát hiện nhưng chưa được index — và nói rõ đây là con số ước lượng. Website của quán cà phê, spa, phòng khám hay một shop vài trăm sản phẩm thường không cần lo crawl budget; nếu trang chưa được index, nguyên nhân thường là chất lượng nội dung, trùng lặp hoặc thiếu liên kết.
Crawl budget gồm những gì
| Thành phần | Nghĩa | Phụ thuộc vào |
|---|---|---|
| Giới hạn năng lực thu thập (crawl capacity limit) | Googlebot có thể thu thập nhanh tới mức nào mà không làm quá tải máy chủ | Máy chủ phản hồi nhanh và ổn định thì giới hạn tăng; chậm hoặc báo lỗi máy chủ thì Googlebot giảm tốc |
| Nhu cầu thu thập (crawl demand) | Google muốn thu thập site tới mức nào | Số URL Google biết, mức độ phổ biến của trang, tần suất nội dung thay đổi |
| Crawl budget | Kết hợp của hai yếu tố trên | Cả hạ tầng lẫn chất lượng và cấu trúc website |
Cũng cần phân biệt: được thu thập không có nghĩa là được index. Google có thể đọc một trang rồi quyết định không đưa vào chỉ mục vì trùng lặp hoặc ít giá trị. Tối ưu crawl budget chỉ giúp Googlebot dành thời gian cho đúng URL, không làm trang kém chất lượng được index.
Dữ liệu cần chuẩn bị
- Số URL thật sự có giá trị trên website và số URL mà hệ thống có thể sinh ra (kể cả do bộ lọc, tham số, phân trang).
- Báo cáo Thống kê thu thập dữ liệu (Crawl stats) trong phần cài đặt của Google Search Console: số yêu cầu, thời gian phản hồi, mã trạng thái, loại tệp.
- Báo cáo lập chỉ mục trang trong Search Console: trang nào được index, trang nào bị loại và lý do.
- Nhật ký máy chủ (server logs) nếu có: cho biết chính xác Googlebot đã gọi URL nào, khi nào, nhận mã trạng thái gì. Cần người làm kỹ thuật trích xuất và xác minh đó đúng là Googlebot.
Quy trình đánh giá và tối ưu 6 bước
Bước 1. Xác định website có đủ lớn để quan tâm
Trả lời ba câu: website có bao nhiêu URL có giá trị? Nội dung thay đổi nhanh đến mức nào? Trang mới hoặc trang cập nhật có bị chậm được thu thập so với nhu cầu kinh doanh không? Nếu site có vài chục tới vài nghìn trang, trang mới thường được thu thập trong thời gian hợp lý và phần lớn trang quan trọng đã được index, thì dừng ở đây — chuyển sang sửa nội dung, liên kết nội bộ và trùng lặp.
Bước 2. Kiểm tra trang bị crawl lãng phí
Với site lớn, xem Googlebot đang tiêu thời gian vào đâu. Các nguồn lãng phí hay gặp: URL sinh ra từ bộ lọc và sắp xếp, URL có tham số phiên hoặc tham số theo dõi, trang kết quả tìm kiếm nội bộ, trang trả về “không tìm thấy” nhưng mã trạng thái vẫn là 200 (soft 404), chuỗi chuyển hướng dài, trang trùng lặp. Nhật ký máy chủ và báo cáo Crawl stats giúp thấy tỷ lệ yêu cầu rơi vào những nhóm URL này.
Bước 3. Quản lý tham số và bộ lọc
Điều hướng theo bộ lọc (faceted navigation) — lọc theo màu, cỡ, giá, thương hiệu — có thể sinh ra số tổ hợp URL gần như vô hạn. Cách xử lý phụ thuộc vào việc tổ hợp đó có đáng được tìm kiếm không: tổ hợp có nhu cầu thật (“váy công sở màu đen”) có thể là trang riêng có nội dung; tổ hợp vô nghĩa nên chặn thu thập bằng robots.txt hoặc không tạo liên kết thu thập được tới chúng. Trang trùng nội dung có thể dùng canonical URL, nhưng lưu ý canonical không ngăn Googlebot đọc trang. Google cũng khuyên không dùng noindex để “tiết kiệm” ngân sách, vì Googlebot vẫn phải tải trang mới thấy thẻ noindex.
Bước 4. Cải thiện phản hồi máy chủ
Máy chủ phản hồi chậm hoặc thường trả lỗi máy chủ khiến Googlebot tự giảm tốc độ thu thập. Kiểm tra thời gian phản hồi trung bình và tỷ lệ lỗi trong báo cáo Crawl stats, làm việc với bên hosting nếu có vấn đề. Trả đúng mã trạng thái: trang đã gỡ vĩnh viễn thì trả 404 hoặc 410, không trả 200 với nội dung “không tìm thấy”; trang chuyển chỗ thì chuyển hướng một bước tới URL cuối.
Bước 5. Cập nhật sitemap
Sitemap nên chỉ chứa URL chuẩn, có thể index, trả mã 200 — không đưa URL tham số, URL đã chuyển hướng hay URL bị chặn. Với nội dung thay đổi, cập nhật ngày sửa (lastmod) khi nội dung thật sự đổi, không cập nhật đồng loạt cho mọi URL. Sitemap giúp Google phát hiện URL nhưng không đảm bảo URL được thu thập hay index — chi tiết ở bài XML sitemap.
Bước 6. Theo dõi log và trạng thái index
Sau mỗi thay đổi, theo dõi vài tuần: tỷ lệ yêu cầu của Googlebot vào URL có giá trị có tăng không, số URL lãng phí có giảm không, trang mới có được thu thập sớm hơn không, báo cáo lập chỉ mục có bớt các trạng thái đã phát hiện nhưng chưa index không. Thay đổi lớn như chặn hàng loạt URL nên làm từng bước và ghi lại ngày thay đổi để đối chiếu.
Ví dụ thực hành: shop nhỏ và sàn lớn
Ví dụ giả định, minh hoạ cách ra quyết định — không phải kết quả đã được xác nhận.
| Shop thời trang online 400 URL | Website rao vặt hàng trăm nghìn tin, đổi hằng ngày | |
|---|---|---|
| Triệu chứng | 30 trang sản phẩm chưa được index | Tin mới mất nhiều ngày mới được thu thập |
| Nguyên nhân hay gặp | Mô tả sản phẩm sao chép từ nhà cung cấp, trang biến thể trùng nhau, thiếu liên kết từ danh mục | Bộ lọc sinh vô số URL, tin hết hạn vẫn trả 200, máy chủ chậm giờ cao điểm |
| Nên làm | Viết lại mô tả, gộp biến thể, thêm liên kết từ danh mục — không cần bàn tới crawl budget | Rà nhật ký máy chủ, chặn tổ hợp lọc vô nghĩa, trả 404/410 cho tin hết hạn, tăng năng lực máy chủ |
Kết luận của ví dụ: website vài trăm URL thường nên xử lý chất lượng và liên kết trước, thay vì ám ảnh ngân sách crawl. Danh sách kiểm tra cơ bản có ở bài SEO audit là gì.
AI giúp được gì
| AI làm tốt | Cần người làm hoặc kiểm tra |
|---|---|
| Tóm tắt, phân nhóm một bảng URL theo mẫu tham số | Trích xuất log, xác minh yêu cầu đúng là từ Googlebot |
| Giải thích ý nghĩa các trạng thái trong báo cáo lập chỉ mục | Quyết định chặn hay giữ một nhóm URL |
| Gợi ý quy tắc chặn cho các mẫu URL lãng phí | Kiểm tra quy tắc không chặn nhầm trang quan trọng trước khi áp dụng |
Rủi ro: một quy tắc robots.txt viết sai có thể chặn cả thư mục sản phẩm. AI có thể đề xuất quy tắc trông hợp lý nhưng sai cú pháp hoặc quá rộng; mọi thay đổi phải được người hiểu kỹ thuật kiểm tra.
Sai lầm thường gặp
- Lo crawl budget cho site vài trăm trang trong khi vấn đề là nội dung mỏng hoặc trùng.
- Dùng noindex để tiết kiệm crawl — Googlebot vẫn phải tải trang để đọc noindex.
- Chặn bằng robots.txt rồi mong trang biến khỏi kết quả — chặn thu thập không đồng nghĩa với bỏ index.
- Để bộ lọc và tham số sinh URL tự do mà không có quy tắc.
- Trả mã 200 cho trang không tồn tại, tạo soft 404.
- Đưa URL chuyển hướng, URL lỗi vào sitemap.
Câu hỏi thường gặp
Website nhỏ có cần tối ưu crawl budget không?
Thường là không. Theo Google, crawl budget chủ yếu là vấn đề của site rất lớn hoặc thay đổi rất nhanh. Site nhỏ nên ưu tiên nội dung chất lượng, tránh trùng lặp, liên kết nội bộ tốt và máy chủ ổn định.
Làm sao biết Googlebot đang thu thập website thế nào?
Xem báo cáo Thống kê thu thập dữ liệu trong phần cài đặt của Google Search Console. Với site lớn, nhật ký máy chủ cho bức tranh chi tiết hơn về từng URL Googlebot đã gọi.
Tăng crawl budget có giúp trang được index không?
Không trực tiếp. Được thu thập chỉ là bước đầu; Google vẫn quyết định có index trang hay không dựa trên chất lượng và mức trùng lặp. Trang kém giá trị được thu thập nhiều hơn vẫn có thể không được index.
Tập trung vào nội dung có giá trị riêng: lên dàn ý và viết bài bằng Content Studio.
Điền hồ sơ thương hiệu một lần: Scalio lập chiến lược, viết bài theo đúng giọng của bạn, xếp lịch đăng và chấm điểm marketing.
Tạo tài khoản miễn phí

