昆明网站开发上线前核对抓取与索引配置,核心不是确认首页能否在浏览器打开,而是确认搜索引擎能否抓到页面、是否允许索引、以及抓到的内容是否与预期一致。常见误解是“网站能访问就会被收录”,实际上抓取、索引、排名是三件事:抓取是搜索引擎发现并下载页面,索引是判断页面是否值得存入候选库,排名才是在索引基础上排序。上线前应把这三步拆开检查,而不是只看页面显示是否正常。
robots.txt 是抓取阶段的通行规则,写错时页面仍能正常访问,但搜索引擎可能不会继续抓取。核对时不要只搜索“有没有 Disallow”,而要逐条看路径是否覆盖了当前站点结构。
Disallow: /,它表示禁止抓取整站,测试环境遗留到正式环境时最容易出现。/css/、/js/、/images/,部分搜索引擎需要这些资源来理解页面渲染结果。Sitemap 地址是否指向正式域名,而不是测试域名或已经废弃的路径。判断结果时注意:robots.txt 只控制抓取,不控制索引。如果页面已经被其他来源链接指向,仍可能出现在索引中,只是没有描述片段。因此看到“被收录”不能反推 robots.txt 没写错。
页面级配置比整站规则更细,常见问题是模板统一输出了 noindex,或者 canonical 指向了错误地址。上线前应抽查首页、栏目页、详情页、分页和搜索页五类模板。
<meta name="robots" content="noindex">。如果测试阶段为防止收录加了它,上线时必须移除或改成 index,follow。<link rel="canonical"> 是否指向当前页面的正式 URL。若所有页面都指向首页,详情页可能不被当作独立页面处理。www 前缀或 http/https。这些差异会造成重复内容判断。适用条件是页面允许被抓取且希望被索引。如果某类页面本就不希望收录,例如站内搜索结果页、带大量参数的筛选页,保留 noindex 是合理做法,但应确认它不会误伤正常内容页。
不要凭感觉判断“应该收录了”。上线后可按以下顺序收集证据:
site: 查询只能作为粗略参考,不同搜索引擎结果差异大,不能当作精确收录量。如果页面返回 404 或 500,先修服务器与链接,不要急着提交索引。如果返回 200 但长期未出现在索引中,可能是内容质量、重复度过高或 canonical 指向他处,需要逐项排除,而不是断言某个原因。
把下面几项做成上线前必过项,比事后反复猜测更有效:
robots.txt 可访问,且未禁止整站和关键资源。noindex,canonical 指向自身正式 URL。下一步建议先抽查首页和一个详情页,按“抓取规则—页面级指令—canonical—sitemap—实际抓取记录”的顺序逐项核对,把发现的问题记录成可复查的清单,再决定是否需要调整模板或提交重新抓取。