上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面没有被自己挡住、最终呈现的地址和内容与预期一致。最有效的做法不是逐项凭记忆检查,而是按固定顺序走一遍可复现的清单,并把每项结果记录在交付文档里。下面这份清单可以直接用于多人协作的张家界网站建设项目。
要查什么:robots.txt 中是否存在 Disallow: /,以及是否误挡了栏目、图片、样式脚本所在目录。
怎么查:在浏览器直接打开站点根目录下的 robots.txt,逐行阅读;再用搜索引擎官方提供的 robots 测试工具验证某条具体网址是否被允许抓取。
结果说明什么:如果整站被禁止,抓取会全面失败;如果只挡了后台或临时目录,属于正常配置。测试工具显示“已屏蔽”时,要区分是规则命中还是文件本身无法访问——这是两种不同原因,不能混为一谈。
要查什么:重点页面是否存在 noindex、nofollow 等标记,测试环境遗留的屏蔽标签是否被带到正式环境。
怎么查:查看页面源代码中的 <meta name="robots">;多人协作时,建议抽查首页、栏目页、详情页各一个,而不是只看首页。
结果说明什么:出现 noindex 的页面即使被抓取也不会进入索引。常见返工点是把测试站的全局屏蔽配置直接复制上线,因此这一步应在上线前单独确认,而不是默认“模板没问题”。
要查什么:带 www 与不带 www、http 与 https、带参数与不带参数等不同入口,是否都通过 301 跳转或 canonical 指向唯一主地址。
怎么查:分别访问几种入口,观察是否跳转到同一最终地址;再查看页面 <link rel="canonical"> 指向的地址是否与最终地址一致。
结果说明什么:如果多个地址都能打开且内容相同,索引可能分散到不同地址上。canonical 指向错误地址时,等于主动把权重信号送给另一个页面,这类问题在交付后才发现,返工成本往往高于上线前修一次。
要查什么:关键内容是否依赖 JavaScript 渲染、服务器是否对搜索引擎返回正常状态码、样式与脚本是否被屏蔽。
怎么查:用抓取测试工具查看某条网址返回的 HTML,确认标题、正文、链接是否直接出现在源码中;同时检查 <title>、<h1>、内链是否可读。
结果说明什么:源码中能看到内容,说明抓取阶段即可读取;只能靠脚本渲染才出现的内容,需要确认渲染环节没有出错。若返回 4xx 或 5xx,先解决服务端问题,再谈索引。
要查什么:sitemap 是否包含主要栏目与详情页、地址是否为最终可访问地址、是否存在大量失效链接。
怎么查:打开 sitemap 文件,抽查若干条地址能否正常打开;再检查重要页面是否至少有一个站内链接指向它。
结果说明什么:sitemap 是辅助发现渠道,不是收录保证;页面若没有任何内链入口,被发现的机会明显降低。发现死链时应记录并修复,而不是只从 sitemap 中删除。
建议按以下顺序执行,每项完成后由另一名协作成员复核:
记录时写清“检查项、检查地址、实际结果、是否通过”,而不是只写“已检查”。这样出现分歧时可以直接复现,减少口头确认带来的返工。
下一步:把上述五项整理成一张交付核对表,指定一名成员在正式上线前执行、另一名成员复核,并将结果随项目文档一并归档。