Dokki 为每个已发布的站点提供明确的控制,决定搜索引擎和 AI 爬虫是否应发现它。发现行为通过公开/未公开设置,在站点级别进行控制。
公开站点
当站点为公开时,Dokki 提供对爬虫友好的公共页面,并在已发布资源之间建立正常链接。已发布页面包含基于冻结资源、工作区/站点上下文和资源标签构建的元数据。
文档页面包括:
规范 URL;
Open Graph 和 Twitter 元数据;
文章或网页 JSON-LD;
面包屑 JSON-LD;
存在标签时的标签关键词;
启用多种已发布语言时的 hreflang 备用链接;
未公开站点
当站点未公开时,页面仍可通过直接链接访问,但会被标记为 noindex 和 nofollow。Dokki 还会返回阻止爬虫或空的发现接口:
robots.txt返回Disallow: /;sitemap.xml返回 404;llms.txt返回 404。
将未公开用于草稿、内部预览、客户特定文档,或任何您希望通过链接共享但不想被索引的内容。
站点地图
sitemap.xml 包含已发布站点的主页和每个已提交的已发布资源。它使用当前有效的公开基础 URL:默认 /pub/<slug>、自定义域名或子目录代理基础。
对于每个页面,sitemap 在可用时使用 frozen_at,否则回退到已发布行或站点时间戳。编辑已发布资源后请提交更改,以便公共快照和 sitemap 时间戳与您希望被抓取的版本一致。
robots.txt
对于公开站点,robots.txt 允许抓取并指向站点的 sitemap URL。对于未公开站点,它禁止所有抓取。该路由与站点使用相同的公开基础提供服务,包括自定义域名和子目录代理。
llms.txt
llms.txt 为 AI 爬虫和助手总结已发布站点。它包含:
站点名称;
来自首页描述或自动生成回退内容的简短摘要;
已提交公共页面的分层 Markdown 地图。
文件夹标签保留信息架构,但只有已发布的资源才会获得链接并计为可读页面。
自定义域名和子路径
自定义域名和子目录代理应保持公共链接、规范 URL、robots.txt、sitemap.xml 和页面路由一致。如果您更改域路由,请直接验证实际公开 URL,并从同一主机和路径检查发现文件。
