Dokki 為每個發布的網站提供明確控制,讓搜尋引擎和 AI 爬蟲是否應發現該網站。發現行為是在網站層級透過「已列出/未列出」設定來控制。
已列出的網站
當網站被列為已列出時,Dokki 會提供利於爬蟲的公開頁面,並在已發布資源之間維持正常連結。發布的頁面包含從凍結資源、工作區/網站脈絡和資源標籤建立的元資料。
文件頁面包含:
canonical URL;
Open Graph 和 Twitter 元資料;
文章或網頁 JSON-LD;
麵包屑 JSON-LD;
有標籤時的標籤關鍵字;
啟用多種發布語言時,提供 hreflang 替代版本。
未列出的網站
當網站被列為未列出時,頁面仍可透過直接連結存取,但會標記為 noindex 和 nofollow。Dokki 也會回傳封鎖爬蟲或空白的探索介面:
robots.txt回傳Disallow: /;sitemap.xml回傳 404;llms.txt回傳 404。
將未列出用於草稿、內部預覽、客戶專屬文件,或任何你想透過連結分享但不被索引的內容。
Sitemap
sitemap.xml 包含發布的網站首頁和每個已提交的發布資源。它使用有效的公開基礎 URL:預設為 /pub/<slug>、自訂網域或子目錄代理基礎。
對每個頁面,sitemap 在可用時使用 frozen_at,否則退回使用發布列或網站時間戳。編輯已發布的資源後請提交變更,以便公開快照和 sitemap 時間戳與你想被爬取的版本一致。
robots.txt
對於已列出的網站,robots.txt 允許爬蟲並指向網站的 sitemap URL。對於未列出的網站,它禁止所有爬蟲。此路由與網站本身使用相同的公開基礎提供,包括自訂網域和子目錄代理。
llms.txt
llms.txt 為 AI 爬蟲和助理總結發布的網站。它包含:
網站名稱;
從首頁描述取得的簡短摘要,或自動生成的替代內容;
已提交公開頁面的階層式 Markdown 地圖。
資料夾標籤保留資訊架構,但只有已發布的資源會獲得連結,並計為可讀頁面。
自訂網域與子路徑
自訂網域和子目錄代理應保持公開連結、canonical URL、robots.txt、sitemap.xml 和頁面路由一致。如果你變更網域路由,請直接驗證公開的實際 URL,並從相同主機和路徑檢查探索檔案。
