这三个术语常同时出现在网站排查中,但作用不同。robots.txt主要控制特定爬虫请求路径,Sitemap提供希望被发现的网址清单,Canonical表达相近页面中的首选网址。
三个技术信号各自负责什么
正确配置要从页面目标出发:是否允许访问、是否希望被发现、是否存在重复版本。一个文件不能替另一个文件完成全部任务。
用robots.txt阻止页面后又期待爬虫读取页面里的noindex或Canonical,会形成互相矛盾的信号。
同一个网址要联合检查
为每类页面建立访问、索引与规范网址决策表,再分别生成配置并通过实际请求核对。
以一个重复参数页为例:若它不应被请求,可以在确认影响后配置爬取规则;若主产品页希望被发现,应返回正常状态并进入站点链接或Sitemap;若多个网址内容等价,则由Canonical、重定向和内链共同表达首选版本。三件事处理的是不同问题。
抽查时不要只打开三个配置文件,而要选择具体网址,记录爬取允许情况、Sitemap是否列出、页面Canonical和最终响应。敏感后台仍需登录和服务器权限保护。信号相互矛盾时,先回到该页面类型的公开目标,再决定改哪一层。
从页面分类到规范版本
1. 列页面类型
区分公开内容、后台、搜索结果、参数页、打印页和废弃页,逐类确定目标。
2. 检查robots
只阻止确实不应被对应爬虫请求的路径,不在其中写未经支持的索引指令。
3. 生成Sitemap
只放稳定、可访问且希望作为规范版本的页面,更新后检查状态码。
4. 核对Canonical
页面内首选网址、重定向、内链和Sitemap尽量一致,不把无关页面都指向首页。
选几类网址做配置抽查
- [ ] 公开内容、后台、搜索结果、参数页、打印页和废弃页逐类写明期望状态,没有一条规则覆盖全部。
- [ ] robots只处理对应爬虫的请求路径,敏感页面另有权限控制,文件中未混入不受支持的指令。
- [ ] Sitemap中的网址均为稳定、可访问且希望作为规范版本的页面,抽查返回状态符合预期。
- [ ] 页面Canonical、重定向、内部链接和Sitemap指向同一首选网址,没有把无关内容集中到首页。
排查时应沿着单个网址同时查看三类信号。robots决定能否请求,Sitemap提供发现线索,Canonical表达首选版本,职责不能互换。
事实边界
本文引用Google公开文档,不能假定所有生成式平台完全遵循同一规则。对其他爬虫应查看其最新官方说明并通过日志验证。

