页面在自己的浏览器里显示正常,不代表抓取方一定拿到相同正文。单页应用还可能返回同一空壳HTML,等脚本执行后才加载标题、正文和链接。
屏幕可见不等于入口稳定
审计需要比较服务器初始响应与渲染结果,同时检查内容是否依赖登录、点击、滚动或失败的接口。每个独立内容视图还应有可直接访问的网址。
只看屏幕截图判断可抓取性,会漏掉状态码、源代码、脚本错误和接口权限。
初始HTML和最终DOM分别看什么
用多个观察层交叉确认:首页入口能发现网址,直接请求有正确响应,渲染后有完整正文,关闭交互也能读取核心内容。
一个详情页在浏览器里看起来完整,直接请求得到的HTML却可能只有空容器,正文还依赖随后失败的接口。审计应分别保存初始响应和渲染后DOM,再关闭缓存、模拟资源失败,确认标题、摘要与核心内容在目标环境中如何出现。
路由也要单独验证:从列表点击正常不代表复制详情网址后仍能恢复页面。刷新、分享、无效slug和移动端都应返回相符的内容与状态。修复前后的两组材料绑定同一部署版本,才能说明变化来自本次实现,而非缓存或测试条件。
把响应、渲染、路由放进同一审计
1. 检查初始响应
直接请求文章网址,记录状态码、响应头以及HTML中是否已有title、主标题和正文摘要。
2. 检查渲染结果
在无缓存环境打开页面,查看最终DOM、控制台错误和网络失败,确认正文不是用户点击后才出现。
3. 检查独立网址
刷新详情页不应回到首页或404;分享地址应能恢复同一内容与元数据。
4. 保留对比证据
保存源HTML、渲染截图、检查日期和部署版本,修复后按同一网址复测。
修复前后必须对应同一部署
- [ ] 直接请求详情网址时记录状态码、响应头,并检查初始HTML里是否已有title、主标题和正文信息。
- [ ] 无缓存渲染保存最终DOM、控制台与网络错误,正文不依赖额外点击才能出现。
- [ ] 详情页刷新、分享和直接打开均恢复同一内容与元数据,未知路径返回真实错误状态。
- [ ] 修复前后的源HTML、渲染截图、检查日期和部署版本成对保存,结论可在相同网址复现。
用户浏览器里看得到正文只是第一份证据;初始响应、渲染过程和独立路由都通过,才说明内容入口稳定。
事实边界
Google公开说明会运行JavaScript,但仍存在处理差异与限制。其他平台是否执行脚本、等待多久或调用哪些资源需要单独验证。

