上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能否正常访问页面、页面是否被允许收录、返回给搜索引擎的内容是否与用户看到的一致。对三亚网站开发项目来说,这一步与地域无关,和服务器位置、备案、内容语言也没有直接关系,按下面四类信号逐项检查即可。
这是最常见的上线事故。开发阶段为了防止测试内容被收录,很多项目会在根目录放一个禁止抓取的 robots.txt,上线时忘记删除或修改。
你的域名/robots.txt,确认没有 Disallow: / 这类整站禁止规则。Sitemap 行指向的地址真实可访问,且返回的是 XML 而不是 404 页面。判断结果:如果存在整站禁止,搜索引擎不会抓取任何页面,索引量会长期为零;如果只是个别目录被挡,表现为部分页面不收录。修改后需要重新抓取 robots.txt 才会生效,具体生效速度取决于搜索引擎的抓取频率,无法人为保证。
robots.txt 管的是“能不能来抓”,页面里的 meta 指令管的是“抓到后能不能索引”。两者要分开检查。
<meta name="robots">。出现 noindex 表示该页不应进入索引,上线后必须确认正式页面没有残留这个值。noindex 和 index 这类互相矛盾的写法,冲突时以更严格的限制为准。<link rel="canonical"> 指向的是不是页面自身的正式地址,而不是测试域名、带参数的地址或已废弃的旧地址。适用条件:多语言、多终端或带筛选参数的页面尤其要核对 canonical,因为这类页面容易互相指向错误,导致正式页面被当作重复内容而不被索引。验收信号是:用抓取工具查看响应时,返回的 HTML 中不含 noindex,canonical 与浏览器地址栏的规范形式一致。
抓取配置正确不代表访问链路正确。上线后常见的问题是旧地址跳转链过长,或者跳转到了错误的目标。
200,而不是 301、302、404 或 500。判断结果:返回 200 说明页面可正常抓取;持续返回 301 且链条过长会浪费抓取配额,也不利于权重集中;返回 404 或 500 则页面根本进不了索引。这一项与是否使用某个框架无关,任何技术栈都要在真实服务器上验证,而不是只在本地开发环境验证。
前面三项是静态检查,这一步是动态验证。使用搜索引擎官方提供的抓取测试工具,或 curl 这类命令行工具,以搜索引擎的 User-Agent 请求页面,观察返回内容。
重点看两点:一是返回的 HTML 里是否包含正文内容,如果页面依赖客户端渲染,而搜索引擎拿到的是空壳,就需要评估是否要做服务端渲染或预渲染;二是返回内容与用户浏览器看到的是否一致,不一致可能触发作弊判定。
检查项清单:
X-Robots-Tag 是否包含 noindex需要说明的是,搜索引擎是否收录、何时收录由搜索引擎自行决定,以上检查只能排除人为阻碍,不能保证收录时间或排名结果。不同搜索引擎的抓取工具和指令支持范围存在差异,应以各自官方文档为准。
下一步建议:把上面五项检查做成一张上线核对表,每次发布新版本或迁移服务器后重新跑一遍,尤其是 robots.txt、noindex 和 canonical 这三项,它们最容易在环境切换时被误改。