SEO
Log File Analysis cho SEO: Cách xem bot thực sự thu thập website
Công cụ crawl cho bạn biết bot CÓ THỂ đi đâu. Nhật ký máy chủ cho biết bot ĐÃ đi đâu — từng URL, từng lần, kèm mã trạng thái máy chủ trả về.
ScalioCập nhật 11 phút đọc

Log file analysis SEO là việc đọc nhật ký truy cập (access log) của máy chủ web để xem các bot tìm kiếm — chủ yếu là Googlebot — đã thực sự yêu cầu những URL nào, bao nhiêu lần, vào lúc nào và nhận về mã trạng thái gì. Mỗi lần có ai đó (người hay bot) gọi tới website, máy chủ ghi một dòng. Gom các dòng của bot lại, bạn có bức tranh thật về cách công cụ tìm kiếm đi qua website, thay vì phỏng đoán.

Điểm khác với một công cụ crawl mô phỏng: công cụ crawl bắt đầu từ trang chủ, đi theo liên kết và cho biết bot có thể tới đâu. Log thì ghi lại những gì đã xảy ra, kể cả URL không còn liên kết nào trỏ tới, URL rác sinh ra từ tham số, hay trang quan trọng mà bot hiếm khi ghé. Nếu bạn đang cân nhắc có cần lo về crawl budget hay không, log là nguồn dữ liệu trả lời câu hỏi đó chính xác nhất.
Một dòng log chứa những gì
Định dạng phụ thuộc máy chủ (Nginx, Apache, LiteSpeed) hoặc CDN, nhưng phần lớn có các trường sau. Bạn không cần đọc hết; SEO chỉ cần vài cột.
| Trường | Ví dụ | Dùng để làm gì trong SEO |
|---|---|---|
| Địa chỉ IP | 66.249.x.x | Xác minh bot có thật là của Google hay chỉ giả danh |
| Thời điểm | 12/Mar/2026:08:15:02 +0700 | Tần suất ghé, trang mới được phát hiện sau bao lâu |
| Phương thức và URL | GET /blog/cach-pha-cold-brew?utm_source=zalo | Bot đang tốn lượt vào đâu, có dính tham số không |
| Mã trạng thái | 200, 301, 404, 500 | Tỷ lệ lỗi, chuyển hướng mà bot gặp |
| User agent | Chuỗi có chữ Googlebot | Lọc dòng của bot; phân biệt bản smartphone và desktop |
| Kích thước, thời gian phản hồi | Tuỳ cấu hình | Phát hiện trang phản hồi chậm hoặc trả về gần như rỗng |
Khi nào doanh nghiệp nhỏ thật sự cần phân tích log
Website 30 trang của một spa hiếm khi cần phân tích log thường xuyên. Nên làm khi có một trong các dấu hiệu sau:
- Trang mới lâu được index dù đã có trong sitemap và có liên kết nội bộ.
- Website có bộ lọc, tham số hoặc tìm kiếm nội bộ sinh ra rất nhiều URL — ví dụ shop thời trang có lọc màu, size, giá.
- Vừa chuyển nền tảng hoặc đổi cấu trúc URL và cần biết bot có đang đi theo chuyển hướng đúng không.
- Search Console báo nhiều lỗi máy chủ (5xx) hoặc số trang “đã phát hiện nhưng chưa được lập chỉ mục” tăng bất thường.
Cần chuẩn bị gì
- Quyền lấy log: từ bảng điều khiển hosting, máy chủ riêng hoặc CDN. Một số gói hosting giá rẻ chỉ giữ log vài ngày — hỏi nhà cung cấp trước.
- Danh sách URL chuẩn bạn muốn được index (từ sitemap hoặc hệ thống quản trị) để đối chiếu.
- Công cụ đọc log: bảng tính cho log nhỏ; công cụ phân tích log chuyên dụng hoặc dòng lệnh khi file lớn.
- Quy tắc xử lý dữ liệu: log chứa IP của cả khách truy cập. Chỉ giữ dòng của bot cho phân tích SEO, xoá phần còn lại, không dán log thô vào công cụ AI công cộng. Việc lưu và xử lý dữ liệu có thể liên quan tới quy định bảo vệ dữ liệu cá nhân như Nghị định 13/2023/NĐ-CP — hỏi người phụ trách pháp lý nếu không chắc.
Quy trình phân tích log file 6 bước
Bước 1. Thu thập log đủ thời gian
Một ngày log chỉ là ảnh chụp; bot có thể ghé trang danh mục mỗi ngày nhưng ghé bài blog cũ vài tuần một lần. Lấy một khoảng đủ dài để thấy nhịp — ví dụ vài tuần — và ghi chú các sự kiện trong khoảng đó: ngày đăng bài hàng loạt, ngày đổi giao diện, ngày máy chủ gặp sự cố. Nếu website đi qua CDN, log ở máy chủ gốc có thể thiếu các lượt được CDN trả từ bộ nhớ đệm; khi đó cần lấy log ở CDN.
Bước 2. Xác minh bot hợp lệ
User agent có chữ “Googlebot” không chứng minh gì — bất kỳ công cụ cào dữ liệu nào cũng có thể giả chuỗi đó. Google hướng dẫn xác minh Googlebot bằng tra ngược DNS địa chỉ IP (tên miền phải thuộc Google), rồi tra xuôi tên đó để chắc nó trỏ lại đúng IP; hoặc đối chiếu IP với danh sách dải IP Google công bố. Bỏ các dòng không xác minh được ra khỏi phân tích, nếu không bạn sẽ kết luận sai về hành vi của Google.
Bước 3. Chuẩn hoá URL và mã trạng thái
Cùng một trang có thể xuất hiện dưới nhiều dạng: có và không có dấu gạch chéo cuối, kèm tham số utm, kèm tham số sắp xếp. Tạo thêm hai cột: URL đã bỏ tham số theo dõi, và nhóm mẫu URL (ví dụ mọi URL có “?sort=” vào một nhóm). Mã trạng thái nên gom thành 2xx, 3xx, 4xx, 5xx để đọc nhanh, sau đó mới đi vào chi tiết từng mã.
Bước 4. Phân tích theo thư mục
Chia URL theo phần đầu đường dẫn — /san-pham/, /danh-muc/, /blog/, /tag/, /tim-kiem — rồi đếm số lượt bot của từng nhóm, so với số URL bạn thật sự muốn được index trong nhóm đó. Câu hỏi cần trả lời: nhóm quan trọng nhất về doanh thu có đang nhận phần lớn lượt thu thập không, hay bot đang dành nhiều lượt cho trang tag, trang tìm kiếm nội bộ?
Bước 5. Tìm crawl lãng phí và lỗi
Lọc các mẫu phổ biến: URL tham số lọc/sắp xếp lặp vô hạn, URL phiên (session), trang 404 bot vẫn quay lại vì còn liên kết cũ đâu đó, chuỗi chuyển hướng nhiều bước, và lỗi 5xx xuất hiện theo giờ cao điểm. Mỗi mẫu cần một hướng xử lý riêng: sửa liên kết nội bộ, dùng robots.txt cho vùng không cần thu thập, sửa redirect 301 thành một bước, hoặc báo nhà cung cấp hosting về lỗi máy chủ.
Bước 6. Đối chiếu với index
Ghép ba danh sách: URL trong sitemap, URL bot đã ghé theo log, và trạng thái index trong báo cáo Lập chỉ mục trang của Search Console (báo cáo Thống kê thu thập dữ liệu trong Search Console là bản tổng hợp do Google cung cấp, tiện xem xu hướng; log cho phép lọc tới từng URL). Trang có trong sitemap nhưng bot không ghé lần nào trong cả khoảng thời gian là tín hiệu cần kiểm tra liên kết nội bộ — có thể đó là trang mồ côi. Trang bot ghé thường xuyên nhưng không được index thì cần xem chất lượng nội dung, trùng lặp hoặc canonical.
Ví dụ thực hành: shop thời trang online 800 sản phẩm
Ví dụ giả định: một shop thời trang online có khoảng 800 trang sản phẩm và 40 trang danh mục, thấy sản phẩm mới mất khá lâu mới xuất hiện trên Google. Người phụ trách lấy log vài tuần từ CDN, giữ lại dòng của Googlebot đã xác minh, rồi tổng hợp theo nhóm URL.
| Nhóm URL | Tỷ trọng lượt bot | Nhận xét | Hướng xử lý |
|---|---|---|---|
| Danh mục có tham số lọc (?mau=, ?size=, ?gia=) | Phần lớn | Tổ hợp lọc gần như vô hạn, nội dung trùng danh mục gốc | Xem lại faceted navigation: chặn thu thập tổ hợp không cần index |
| Trang sản phẩm | Một phần nhỏ | Sản phẩm mới ít được ghé | Đưa sản phẩm mới lên danh mục, liên kết từ trang chủ |
| Sản phẩm đã xoá | Đáng kể | Trả về 404 nhưng vẫn còn liên kết trong bài blog cũ | Sửa liên kết; chuyển hướng nếu có sản phẩm thay thế |
| Trang tìm kiếm nội bộ | Có | URL tìm kiếm bị liên kết từ khối “từ khoá hot” | Bỏ liên kết, cân nhắc chặn thu thập |
Kết luận rút ra không phải “Google không thích shop”, mà là bot đang dành phần lớn lượt vào URL không cần index. Sau khi sửa, shop lấy log lại cùng độ dài để so sánh — so trước và sau, không so với một con số “chuẩn” nào.
AI giúp được gì khi phân tích log
| AI làm tốt | Người phải làm hoặc kiểm tra |
|---|---|
| Viết biểu thức chính quy để tách thư mục, gom tham số | Chạy thử trên mẫu nhỏ, kiểm tra không gom nhầm nhóm |
| Giải thích ý nghĩa một mã trạng thái hay mẫu URL lạ | Xác nhận với người phụ trách web xem URL đó sinh ra từ đâu |
| Tóm tắt bảng tổng hợp thành vài phát hiện chính | Quyết định ưu tiên sửa gì dựa trên doanh thu và công sức |
AI rất dễ đưa ra kết luận nghe hợp lý từ dữ liệu thiếu — ví dụ quả quyết “bot bỏ qua nhóm blog” khi thật ra log chỉ có ba ngày. Luôn ghi kèm khoảng thời gian và số dòng đã phân tích cạnh mỗi kết luận.
Sai lầm thường gặp
- Tin user agent mà không xác minh IP, khiến lượt của công cụ cào dữ liệu bị tính là Googlebot.
- Chỉ lấy log máy chủ gốc khi phần lớn lượt truy cập được CDN phục vụ.
- Phân tích quá ngắn, rồi kết luận trang nào đó “không bao giờ được ghé”.
- Chặn thu thập trang đang có noindex: bot không đọc được trang thì cũng không thấy noindex.
- Giữ log có IP khách hàng lâu hơn cần thiết hoặc gửi cho bên ngoài không có thoả thuận.
Câu hỏi thường gặp
Website nhỏ có cần phân tích log file không?
Thường không cần làm định kỳ. Hãy làm khi có dấu hiệu cụ thể: trang mới lâu được index, website sinh nhiều URL tham số, vừa đổi cấu trúc URL hoặc Search Console báo nhiều lỗi máy chủ.
Log file khác gì báo cáo Thống kê thu thập dữ liệu trong Search Console?
Báo cáo trong Search Console là số liệu tổng hợp do Google cung cấp, tiện xem xu hướng. Log là dữ liệu gốc trên máy chủ của bạn, ghi từng yêu cầu, cho phép lọc tới từng URL và đối chiếu với sitemap.
Làm sao biết lượt truy cập đúng là Googlebot?
Đừng dựa vào user agent. Hãy tra ngược DNS địa chỉ IP để xem tên miền có thuộc Google không, sau đó tra xuôi để chắc tên đó trỏ lại đúng IP, hoặc đối chiếu IP với danh sách dải IP Google công bố.
Khi bot đã ghé đủ, hãy chắc nội dung đáng được index — lên dàn ý bài blog theo giọng thương hiệu cùng Scalio.
Điền hồ sơ thương hiệu một lần: Scalio lập chiến lược, viết bài theo đúng giọng của bạn, xếp lịch đăng và chấm điểm marketing.
Tạo tài khoản miễn phí

