SEO

Orphan Page là gì? Cách tìm và xử lý trang không có liên kết nội bộ

Công cụ crawl báo website có 240 trang. Sitemap có 310. Search Console thấy lượt hiển thị ở 275 URL. Những con số lệch nhau đó chính là nơi trang mồ côi đang trốn.

ScalioCập nhật 9 phút đọc

Orphan Page là gì? Cách tìm và xử lý trang không có liên kết nội bộ

Orphan page (trang mồ côi) là trang tồn tại trên website, có thể truy cập bằng URL, nhưng không có liên kết nội bộ nào từ các trang khác trỏ tới. Người đọc gần như không thể tình cờ tới trang đó khi đi quanh website, còn công cụ tìm kiếm chỉ biết tới nó nếu thấy trong sitemap, qua liên kết từ website khác hoặc từ lần thu thập trước.

Một chiếc thuyền đơn độc giữa mặt nước lúc hoàng hôn

Bài internal linking đã nói về cách xây hệ thống liên kết nội bộ tốt nói chung, trong đó tìm trang mồ côi chỉ là một bước. Bài này đi sâu vào đúng bước đó: dùng nguồn dữ liệu nào để phát hiện trang mồ côi, vì sao một công cụ crawl đơn lẻ không bao giờ tìm ra chúng, và cách phân loại để quyết định xử lý từng trang.

Vì sao công cụ crawl không tự tìm ra trang mồ côi

Công cụ crawl hoạt động giống bot: bắt đầu từ trang chủ, đi theo từng liên kết. Trang không có liên kết nào trỏ tới thì crawl cũng không tới được — nên danh sách crawl theo định nghĩa không chứa trang mồ côi. Muốn thấy chúng, phải so danh sách crawl với các nguồn biết về URL theo cách khác:

NguồnBiết URL nhờ đâuĐiểm mạnhĐiểm yếu
Crawl từ trang chủĐi theo liên kếtCho biết trang nào đang được liên kếtKhông thấy trang mồ côi
XML sitemapHệ thống quản trị tự liệt kêLiệt kê trang bạn muốn được indexCó thể thiếu trang, hoặc còn trang cũ
Danh sách từ hệ thống quản trịCơ sở dữ liệu bài, sản phẩmĐầy đủ nhất về nội dung đang cóCần quyền xuất dữ liệu
Search ConsoleTrang có lượt hiển thị, trang Google đã biếtCho thấy trang mồ côi vẫn đang có giá trị tìm kiếmChỉ thấy trang Google đã biết
Công cụ phân tích truy cậpTrang có người xemPhát hiện landing page chỉ nhận lượt từ quảng cáo, emailChỉ thấy trang có lượt xem
Log máy chủMọi yêu cầu, kể cả của botCho thấy bot vẫn ghé trang mồ côi hay khôngCần quyền và công xử lý — xem log file analysis

Trang mồ côi = URL có trong ít nhất một nguồn “biết theo cách khác”, trả mã 200, nhưng không có trong danh sách crawl. Cũng cần để ý trang gần như mồ côi: chỉ được liên kết bằng nút JavaScript, ô tìm kiếm, form, hoặc chỉ từ trang đã noindex — trên lý thuyết có đường vào nhưng bot khó đi theo.

Cần chuẩn bị gì

  • Công cụ crawl chạy được từ trang chủ, xuất danh sách URL có thể index.
  • File sitemap hiện tại và, nếu được, danh sách URL xuất từ hệ thống quản trị.
  • Báo cáo Hiệu suất của Search Console xuất theo trang trong vài tháng gần nhất.
  • Bảng tính để chuẩn hoá URL (bỏ tham số, thống nhất dấu gạch chéo cuối, http/https) rồi so khớp.

Quy trình tìm và xử lý trang mồ côi 6 bước

Bước 1. Kết hợp dữ liệu crawl, sitemap và analytics

Chuẩn hoá mọi danh sách về cùng một dạng URL, rồi gộp lại thành một bảng với các cột: có trong crawl, có trong sitemap, có trong hệ thống quản trị, có lượt hiển thị trên Search Console, có lượt xem. Lọc các dòng không có trong crawl nhưng có ở ít nhất một cột khác. Kiểm tra mã trạng thái của từng URL trong danh sách lọc — URL đã chuyển hướng hoặc 404 không phải trang mồ côi, mà là rác trong sitemap cần dọn.

Bước 2. Xác minh trang còn giá trị

Với mỗi trang mồ côi thật, trả lời ba câu: nội dung còn đúng không (giá, lịch, chính sách)? Có còn nhu cầu tìm kiếm hoặc mục đích kinh doanh không? Có trang khác đang làm tốt hơn việc này không? Từ đó xếp vào bốn nhóm: giữ và nối lại; gộp vào trang khác; giữ cho mục đích riêng nhưng không cần index (ví dụ landing page chạy quảng cáo); gỡ bỏ.

Bước 3. Gắn vào cụm nội dung phù hợp

Trang được giữ cần một “nhà”: một danh mục, một pillar page hay một trang dịch vụ mà nó thuộc về về mặt chủ đề. Trang mồ côi thường xuất hiện vì không ai biết đặt nó ở đâu — bài blog viết lẻ không thuộc chủ đề nào, case study đăng xong không gắn vào trang dịch vụ. Xác định nhà trước, thêm liên kết sau.

Bước 4. Thêm link từ trang liên quan

Thêm liên kết từ trang cha trong cụm và từ hai, ba trang có chủ đề gần nhất, với anchor text mô tả nội dung trang đích. Ưu tiên liên kết đặt trong nội dung chính, nơi người đọc có lý do bấm, hơn là chỉ thêm vào footer. Nếu trang quan trọng về kinh doanh, cân nhắc thêm vào menu hoặc trang danh mục để nó nằm gần trang chủ.

Bước 5. Noindex hoặc xoá khi cần

Trang gộp vào trang khác thì dùng redirect 301 về trang đích tương đương. Landing page chỉ dành cho quảng cáo hoặc chiến dịch email có thể giữ mồ côi có chủ đích, đặt noindex và bỏ khỏi sitemap. Trang hết giá trị và không có trang thay thế thì gỡ, để URL trả 404 hoặc 410 và xoá khỏi sitemap — xem thêm cách xử lý lỗi 404.

Bước 6. Theo dõi lại

Chạy lại crawl sau khi sửa để chắc trang đã có đường vào. Sau đó đặt lịch kiểm tra định kỳ, ví dụ mỗi quý, vì trang mồ côi sinh ra liên tục: sản phẩm gỡ khỏi danh mục nhưng còn trang, bài blog bị đẩy xuống trang phân trang sâu, menu đổi làm rơi một mục. Cách phòng hiệu quả nhất là đưa bước “bài này được liên kết từ đâu?” vào quy trình duyệt trước khi đăng.

Ví dụ thực hành: công ty phần mềm B2B nhỏ

Ví dụ giả định: một công ty phần mềm quản lý kho làm website có trang tính năng, blog và vài case study. Đối chiếu ba nguồn cho ra danh sách trang mồ côi sau:

Trang mồ côiTìm thấy quaNhómXử lý
Case study khách hàng ngành dượcSitemap, Search Console có lượt hiển thịGiữ và nối lạiLiên kết từ trang tính năng quản lý lô, hạn dùng và trang ngành
Landing page webinar đã quaCông cụ phân tích truy cậpGỡChuyển 301 về trang tài liệu webinar nếu có bản ghi, không thì 404
Landing page chạy quảng cáo tìm kiếmCông cụ phân tích truy cậpMồ côi có chủ đíchGiữ, đặt noindex, bỏ khỏi sitemap
Ba bài blog về cùng chủ đề kiểm kêHệ thống quản trịGộpViết lại thành một bài đầy đủ, 301 hai bài còn lại
Ví dụ giả định — minh hoạ cách phân loại

Case study là loại trang dễ mồ côi nhất ở doanh nghiệp B2B và cũng thường có giá trị nhất khi khách đang so sánh nhà cung cấp — bài AI marketing B2B bàn thêm về vai trò của nội dung dạng này.

AI giúp được gì

  • Chuẩn hoá và so khớp danh sách URL từ nhiều nguồn, viết công thức bảng tính để gộp.
  • Gợi ý trang cha phù hợp cho mỗi trang mồ côi dựa trên tiêu đề và đoạn mở đầu.
  • Đề xuất câu dẫn và anchor text để chèn liên kết tự nhiên vào bài liên quan.

Quyết định giữ, gộp hay gỡ phụ thuộc vào giá trị kinh doanh — case study đó có còn được khách cho phép dùng không, sản phẩm đó còn bán không. AI không có thông tin này nếu bạn không cung cấp.

Sai lầm thường gặp

  • Chỉ dùng một công cụ crawl rồi kết luận website không có trang mồ côi.
  • Coi mọi trang mồ côi là rác và xoá hàng loạt, kể cả trang đang có lượt tìm kiếm.
  • Chỉ thêm liên kết ở footer hoặc trang “sitemap HTML” rồi coi như xong.
  • Để trang mồ côi trong sitemap mãi mà không quyết định số phận của nó.
  • Quên landing page quảng cáo và để chúng được index, cạnh tranh với trang dịch vụ chính.

Câu hỏi thường gặp

Trang có trong sitemap thì còn là trang mồ côi không?

Vẫn có thể. Sitemap giúp Google biết URL tồn tại nhưng không phải liên kết nội bộ. Trang chỉ có trong sitemap mà không được trang nào liên kết vẫn là trang mồ côi.

Landing page chạy quảng cáo có cần liên kết nội bộ không?

Không bắt buộc. Nếu trang chỉ phục vụ quảng cáo và không cần xuất hiện trên Google, có thể để mồ côi có chủ đích, đặt noindex và bỏ khỏi sitemap.

Bao lâu nên kiểm tra trang mồ côi một lần?

Tuỳ tốc độ thay đổi website. Website nhỏ ít cập nhật có thể kiểm tra mỗi quý hoặc sau mỗi lần đổi menu, đổi giao diện, gỡ nhiều sản phẩm. Đưa bước kiểm tra liên kết vào quy trình duyệt bài sẽ giảm số trang mồ côi phát sinh.

Lên dàn ý bài theo cụm chủ đề để mỗi bài mới đều có chỗ đứng — thử cùng Scalio.

Điền hồ sơ thương hiệu một lần: Scalio lập chiến lược, viết bài theo đúng giọng của bạn, xếp lịch đăng và chấm điểm marketing.

Tạo tài khoản miễn phí

Bài viết liên quan