上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能访问页面、页面愿意被收录、收录后拿到的是正确版本。对外贸网站来说,还要额外确认多语言、多币种、多地区版本之间不会互相抢占或误判重复。下面用一个假设例子展开,说明具体核对步骤和常见错误。
假设你有一个外贸企业站,英文为主站,另有德语、西班牙语两个语言目录,产品页由筛选参数生成,部分旧页面已做301。上线前可以按以下顺序核对。
robots.txt:确认没有误屏蔽整站或关键目录。常见错误是把测试环境的 Disallow: / 带上线,导致全站无法被抓取。meta robots:确认正式页面没有残留 noindex。测试阶段为防止收录加上的标签,上线时最容易忘记删除。sitemap.xml:确认其中只包含希望被收录的规范URL,且能正常打开、没有404或跳转链。canonical:确认每个页面指向自己或正确的规范版本,尤其是筛选参数页和语言版本页。hreflang 是否成对互指、是否包含自身、语言代码与地区代码是否写错。抓取是索引的前提。核对时重点看三类拦截:服务器层、协议层、页面层。
robots.txt 是否可正常访问且返回200。如果它返回404,爬虫会按“允许全部”处理;如果返回5xx,部分爬虫会暂停抓取,这属于可能原因,需结合日志确认,不能直接断定。meta robots 和 X-Robots-Tag 响应头。后者常被忽略,如果服务器统一加了 noindex,页面即使没有meta标签也不会被收录。适用条件:以上检查在正式域名、正式服务器环境下进行。判断结果以实际返回的HTTP响应和页面源码为准,不依赖后台开关的显示状态。
能被抓取不等于会被收录,也不等于收录的是正确版本。外贸站最容易出问题的是重复内容和语言版本。
canonical 指向主版本。注意canonical是建议信号,不是强制指令,所以最好同时让其他版本不可直接访问或做301。hreflang 互相指向,不要全部canonical到英文页,否则其他语言版本可能不被收录。配置核对完不等于生效,上线后需要实际验证。可以执行这几步:
site: 加域名,观察已收录页面数量和类型,判断是否有大量参数页或错误版本被收录。hreflang 与canonical。需要说明的是,收录和展示由搜索引擎决定,核对配置只能排除自身可控的障碍,不能保证收录时间或排名结果。
Disallow: / 或 noindex 未清除。hreflang 只写单向,或语言代码与页面实际语言不符。下一步建议:在正式域名下逐条打开上述检查项,把每个URL的实际响应码、canonical和robots状态记录成一张表,再与sitemap和日志对照。发现不一致的地方先修正,再提交URL检查,不要等上线后再回头排查。