SEO
Orphan Page là gì? Cách tìm và xử lý trang không có liên kết nội bộ
Công cụ crawl báo website có 240 trang. Sitemap có 310. Search Console thấy lượt hiển thị ở 275 URL. Những con số lệch nhau đó chính là nơi trang mồ côi đang trốn.
ScalioCập nhật 9 phút đọc

Orphan page (trang mồ côi) là trang tồn tại trên website, có thể truy cập bằng URL, nhưng không có liên kết nội bộ nào từ các trang khác trỏ tới. Người đọc gần như không thể tình cờ tới trang đó khi đi quanh website, còn công cụ tìm kiếm chỉ biết tới nó nếu thấy trong sitemap, qua liên kết từ website khác hoặc từ lần thu thập trước.

Bài internal linking đã nói về cách xây hệ thống liên kết nội bộ tốt nói chung, trong đó tìm trang mồ côi chỉ là một bước. Bài này đi sâu vào đúng bước đó: dùng nguồn dữ liệu nào để phát hiện trang mồ côi, vì sao một công cụ crawl đơn lẻ không bao giờ tìm ra chúng, và cách phân loại để quyết định xử lý từng trang.
Vì sao công cụ crawl không tự tìm ra trang mồ côi
Công cụ crawl hoạt động giống bot: bắt đầu từ trang chủ, đi theo từng liên kết. Trang không có liên kết nào trỏ tới thì crawl cũng không tới được — nên danh sách crawl theo định nghĩa không chứa trang mồ côi. Muốn thấy chúng, phải so danh sách crawl với các nguồn biết về URL theo cách khác:
| Nguồn | Biết URL nhờ đâu | Điểm mạnh | Điểm yếu |
|---|---|---|---|
| Crawl từ trang chủ | Đi theo liên kết | Cho biết trang nào đang được liên kết | Không thấy trang mồ côi |
| XML sitemap | Hệ thống quản trị tự liệt kê | Liệt kê trang bạn muốn được index | Có thể thiếu trang, hoặc còn trang cũ |
| Danh sách từ hệ thống quản trị | Cơ sở dữ liệu bài, sản phẩm | Đầy đủ nhất về nội dung đang có | Cần quyền xuất dữ liệu |
| Search Console | Trang có lượt hiển thị, trang Google đã biết | Cho thấy trang mồ côi vẫn đang có giá trị tìm kiếm | Chỉ thấy trang Google đã biết |
| Công cụ phân tích truy cập | Trang có người xem | Phát hiện landing page chỉ nhận lượt từ quảng cáo, email | Chỉ thấy trang có lượt xem |
| Log máy chủ | Mọi yêu cầu, kể cả của bot | Cho thấy bot vẫn ghé trang mồ côi hay không | Cần quyền và công xử lý — xem log file analysis |
Trang mồ côi = URL có trong ít nhất một nguồn “biết theo cách khác”, trả mã 200, nhưng không có trong danh sách crawl. Cũng cần để ý trang gần như mồ côi: chỉ được liên kết bằng nút JavaScript, ô tìm kiếm, form, hoặc chỉ từ trang đã noindex — trên lý thuyết có đường vào nhưng bot khó đi theo.
Cần chuẩn bị gì
- Công cụ crawl chạy được từ trang chủ, xuất danh sách URL có thể index.
- File sitemap hiện tại và, nếu được, danh sách URL xuất từ hệ thống quản trị.
- Báo cáo Hiệu suất của Search Console xuất theo trang trong vài tháng gần nhất.
- Bảng tính để chuẩn hoá URL (bỏ tham số, thống nhất dấu gạch chéo cuối, http/https) rồi so khớp.
Quy trình tìm và xử lý trang mồ côi 6 bước
Bước 1. Kết hợp dữ liệu crawl, sitemap và analytics
Chuẩn hoá mọi danh sách về cùng một dạng URL, rồi gộp lại thành một bảng với các cột: có trong crawl, có trong sitemap, có trong hệ thống quản trị, có lượt hiển thị trên Search Console, có lượt xem. Lọc các dòng không có trong crawl nhưng có ở ít nhất một cột khác. Kiểm tra mã trạng thái của từng URL trong danh sách lọc — URL đã chuyển hướng hoặc 404 không phải trang mồ côi, mà là rác trong sitemap cần dọn.
Bước 2. Xác minh trang còn giá trị
Với mỗi trang mồ côi thật, trả lời ba câu: nội dung còn đúng không (giá, lịch, chính sách)? Có còn nhu cầu tìm kiếm hoặc mục đích kinh doanh không? Có trang khác đang làm tốt hơn việc này không? Từ đó xếp vào bốn nhóm: giữ và nối lại; gộp vào trang khác; giữ cho mục đích riêng nhưng không cần index (ví dụ landing page chạy quảng cáo); gỡ bỏ.
Bước 3. Gắn vào cụm nội dung phù hợp
Trang được giữ cần một “nhà”: một danh mục, một pillar page hay một trang dịch vụ mà nó thuộc về về mặt chủ đề. Trang mồ côi thường xuất hiện vì không ai biết đặt nó ở đâu — bài blog viết lẻ không thuộc chủ đề nào, case study đăng xong không gắn vào trang dịch vụ. Xác định nhà trước, thêm liên kết sau.
Bước 4. Thêm link từ trang liên quan
Thêm liên kết từ trang cha trong cụm và từ hai, ba trang có chủ đề gần nhất, với anchor text mô tả nội dung trang đích. Ưu tiên liên kết đặt trong nội dung chính, nơi người đọc có lý do bấm, hơn là chỉ thêm vào footer. Nếu trang quan trọng về kinh doanh, cân nhắc thêm vào menu hoặc trang danh mục để nó nằm gần trang chủ.
Bước 5. Noindex hoặc xoá khi cần
Trang gộp vào trang khác thì dùng redirect 301 về trang đích tương đương. Landing page chỉ dành cho quảng cáo hoặc chiến dịch email có thể giữ mồ côi có chủ đích, đặt noindex và bỏ khỏi sitemap. Trang hết giá trị và không có trang thay thế thì gỡ, để URL trả 404 hoặc 410 và xoá khỏi sitemap — xem thêm cách xử lý lỗi 404.
Bước 6. Theo dõi lại
Chạy lại crawl sau khi sửa để chắc trang đã có đường vào. Sau đó đặt lịch kiểm tra định kỳ, ví dụ mỗi quý, vì trang mồ côi sinh ra liên tục: sản phẩm gỡ khỏi danh mục nhưng còn trang, bài blog bị đẩy xuống trang phân trang sâu, menu đổi làm rơi một mục. Cách phòng hiệu quả nhất là đưa bước “bài này được liên kết từ đâu?” vào quy trình duyệt trước khi đăng.
Ví dụ thực hành: công ty phần mềm B2B nhỏ
Ví dụ giả định: một công ty phần mềm quản lý kho làm website có trang tính năng, blog và vài case study. Đối chiếu ba nguồn cho ra danh sách trang mồ côi sau:
| Trang mồ côi | Tìm thấy qua | Nhóm | Xử lý |
|---|---|---|---|
| Case study khách hàng ngành dược | Sitemap, Search Console có lượt hiển thị | Giữ và nối lại | Liên kết từ trang tính năng quản lý lô, hạn dùng và trang ngành |
| Landing page webinar đã qua | Công cụ phân tích truy cập | Gỡ | Chuyển 301 về trang tài liệu webinar nếu có bản ghi, không thì 404 |
| Landing page chạy quảng cáo tìm kiếm | Công cụ phân tích truy cập | Mồ côi có chủ đích | Giữ, đặt noindex, bỏ khỏi sitemap |
| Ba bài blog về cùng chủ đề kiểm kê | Hệ thống quản trị | Gộp | Viết lại thành một bài đầy đủ, 301 hai bài còn lại |
Case study là loại trang dễ mồ côi nhất ở doanh nghiệp B2B và cũng thường có giá trị nhất khi khách đang so sánh nhà cung cấp — bài AI marketing B2B bàn thêm về vai trò của nội dung dạng này.
AI giúp được gì
- Chuẩn hoá và so khớp danh sách URL từ nhiều nguồn, viết công thức bảng tính để gộp.
- Gợi ý trang cha phù hợp cho mỗi trang mồ côi dựa trên tiêu đề và đoạn mở đầu.
- Đề xuất câu dẫn và anchor text để chèn liên kết tự nhiên vào bài liên quan.
Quyết định giữ, gộp hay gỡ phụ thuộc vào giá trị kinh doanh — case study đó có còn được khách cho phép dùng không, sản phẩm đó còn bán không. AI không có thông tin này nếu bạn không cung cấp.
Sai lầm thường gặp
- Chỉ dùng một công cụ crawl rồi kết luận website không có trang mồ côi.
- Coi mọi trang mồ côi là rác và xoá hàng loạt, kể cả trang đang có lượt tìm kiếm.
- Chỉ thêm liên kết ở footer hoặc trang “sitemap HTML” rồi coi như xong.
- Để trang mồ côi trong sitemap mãi mà không quyết định số phận của nó.
- Quên landing page quảng cáo và để chúng được index, cạnh tranh với trang dịch vụ chính.
Câu hỏi thường gặp
Trang có trong sitemap thì còn là trang mồ côi không?
Vẫn có thể. Sitemap giúp Google biết URL tồn tại nhưng không phải liên kết nội bộ. Trang chỉ có trong sitemap mà không được trang nào liên kết vẫn là trang mồ côi.
Landing page chạy quảng cáo có cần liên kết nội bộ không?
Không bắt buộc. Nếu trang chỉ phục vụ quảng cáo và không cần xuất hiện trên Google, có thể để mồ côi có chủ đích, đặt noindex và bỏ khỏi sitemap.
Bao lâu nên kiểm tra trang mồ côi một lần?
Tuỳ tốc độ thay đổi website. Website nhỏ ít cập nhật có thể kiểm tra mỗi quý hoặc sau mỗi lần đổi menu, đổi giao diện, gỡ nhiều sản phẩm. Đưa bước kiểm tra liên kết vào quy trình duyệt bài sẽ giảm số trang mồ côi phát sinh.
Lên dàn ý bài theo cụm chủ đề để mỗi bài mới đều có chỗ đứng — thử cùng Scalio.
Điền hồ sơ thương hiệu một lần: Scalio lập chiến lược, viết bài theo đúng giọng của bạn, xếp lịch đăng và chấm điểm marketing.
Tạo tài khoản miễn phí

