改动 robots.txt 之前,最稳妥的做法是先把当前线上文件完整复制一份,存成带日期和来源标识的文件,并记录它的获取方式、HTTP 状态码和内容摘要。这样做的目的不是走流程,而是一旦新规则写错、误屏蔽整站或放开了不该放开的内容,你能拿原始版本逐字比对并快速回滚。下面用一个假设例子展开,说明具体步骤和容易踩的坑。
假设你的站点根目录下已有 robots.txt,内容只有两行:允许所有抓取,并指向站点地图。现在你想临时屏蔽一个测试目录,于是直接在线编辑,把 Disallow: /test/ 写成 Disallow: /,少写了目录名。这个错误会让整站被限制抓取。如果你事先保存了原始文件,回滚只需把备份内容覆盖回去;如果没有,你只能凭记忆重写,很可能漏掉原来的站点地图行或某条例外规则。
这个例子里真正要保存的,是改动前的完整原文,而不是你记得的“大概内容”。
robots-20250101-original.txt,存放在版本控制、云盘或本地备份目录中,不要只留在编辑器缓存里。如果站点使用版本控制管理静态文件,更简单的做法是先提交一次当前状态,再在新提交里修改。这样原始状态天然留在提交历史中,回滚成本最低。
第一,robots.txt 的限制抓取,不等于可靠的索引移除。被限制抓取的页面仍可能因为外部链接等原因出现在搜索结果中,所以不要把改 robots.txt 当成删除内容的替代手段。第二,站点地图写进 robots.txt 只是给出发现线索,不保证收录;HTTPS 也不等于安全无漏洞或排名提升。这些判断都要和保存原始状态这件事分开看待,避免把回滚方案误当成整体 SEO 方案。
另外,不同搜索引擎对 robots.txt 的支持细节和抓取行为需要分别核查,不要假设一份规则在所有引擎上表现完全一致。改动前保存原始状态,正是为了在发现差异时能快速退回。
现在就去获取你站点当前的 robots.txt,按上面的步骤存成一份带日期和校验值的备份文件,并确认它能被正常打开和比对。完成这一步之后,再动手修改规则,改完同样保存一份新版本,这样任何一次调整都有可回退的起点。