要取得可复查的网店收录状态证据,核心是让每一次观察都能被第三方按时间、URL、来源和原始响应重新验证。不要只截图搜索结果页或后台概览,而应保存请求记录、响应头、页面源码、站点地图提交回执和索引状态查询结果,并注明采集时间与工具版本。可复查意味着别人拿着你的记录,能在相同条件下得到相同结论,或者至少能判断差异来自哪里。
“网店收录”至少包含三种不同状态:搜索引擎已抓取但未索引、已索引但未展示、已展示但排名或流量不符合预期。三种状态需要的证据不同。如果只保存“搜不到商品页”的截图,无法区分是抓取失败、索引被移除,还是查询词与页面主题不匹配。
site: 查询结果、页面 canonical 与 meta robots 原始值。先确定你要证明哪一种状态,再决定收集哪些材料。目标不清时,收集越多越容易把无关数据当成结论。
假设验收目标是“证明某商品页在指定日期未被索引,且原因不是 robots.txt 拦截”。倒推需要以下资料:
X-Robots-Tag。<meta name="robots"> 与 <link rel="canonical">。这些材料要能回答三个问题:页面是否允许抓取、页面是否允许索引、搜索引擎是否实际处理过。缺少任意一项,结论都可能被推翻。
可复查的证据要求采集条件一致。以下变量如果不记录,复查时无法判断差异来源:
如果使用命令行采集,可以用 curl -I 获取响应头,用 curl -s 获取源码,并把输出重定向到带时间戳的文件。示例:
curl -I -A "Mozilla/5.0" https://example.com/item/123 > headers_20250101.txt
这里的 example.com 是占位域名,实际使用时替换为你的网店域名。保存后不要修改文件内容,文件名包含日期和 URL 标识。
同一现象可能有多个解释。例如商品页未被索引,可能原因包括:robots.txt 禁止抓取、meta robots 设置为 noindex、canonical 指向其他页面、服务器返回 404 或 503、页面内容与多个 URL 重复、站点地图未包含该 URL。这些是可能原因,不是已定位原因。
要定位原因,需要逐项排除。检查顺序可以是:
curl -I 确认 HTTP 状态码为 200,且响应头没有 X-Robots-Tag: noindex。<meta name="robots">,确认没有 noindex。Disallow 规则覆盖该路径。只有完成排除后,才能把“已经定位的原因”写成具体结论。例如“服务器日志显示该 URL 在指定日期返回 503,且官方工具显示抓取失败”,而不是“可能因为服务器问题”。
证据要交给他人复查,需要统一命名和存放规则。建议按“日期-URL标识-证据类型”命名,例如 20250101-item123-headers.txt、20250101-item123-source.html、20250101-robots.txt。每个文件旁边附一个说明文件,写明采集时间、采集命令、采集人、预期用途。
复查时,按相同 URL、相同时间窗口、相同来源重新采集一次。如果结果一致,说明证据可复查;如果结果不一致,先检查采集条件是否变化,而不是直接断定收录状态改变。robots.txt 的抓取限制不等于可靠的索引移除;站点地图不保证收录;HTTPS 不保证安全无漏洞或排名。不同搜索引擎对同一 URL 的处理可能不同,必须分别核查并分别记录。
下一步:选一个你怀疑未被收录的商品页,按上面的清单采集一次完整证据,并把“可能原因”逐项排除到只剩一个可验证的结论。