a5诊断怎样判断采集是否遗漏:从抽样对照到差异定位

📍 WDQWDWQD987AAAAA:216.73.216.25
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /425d11900bc1.html
📄

a5诊断怎样判断采集是否遗漏:从抽样对照到差异定位

判断采集是否遗漏,不能只看采集程序有没有报错,也不能只看最终入库数量。更可靠的做法是:先确定一个可复核的对照基准,再用抽样或全量比对找出“基准里有、采集结果里没有”的记录,最后回到采集日志和页面结构确认遗漏发生在哪一步。对已有项目做a5诊断时,这一步最关键的是建立对照基准,没有基准就只能凭感觉判断。

准备阶段:先确定拿什么当对照基准

遗漏是相对概念,必须先明确“应该采到什么”。常见基准有三类,适用条件不同:

选基准时要检查两点:基准本身是否完整,以及基准与采集目标是否同一口径。比如列表页只展示前若干页,就不能把它当成全量基准;接口返回的字段和采集入库的字段含义不一致,也不能直接比数量。

实施阶段:用可执行步骤找出遗漏项

假设要诊断一个分类列表的采集完整性,可以按下面的步骤做。以下为方法示例,不涉及具体站点数据。

  1. 选一个分类,翻到最后一页,记录总页数和每页条目数,算出预期条目总数。
  2. 把每页的条目链接或唯一标识复制出来,去重后得到一个预期集合。
  3. 从采集结果中导出同一分类的记录,提取对应的唯一标识,得到实际集合。
  4. 对两个集合做差集:预期有、实际没有的,就是疑似遗漏项。
  5. 逐条打开疑似遗漏项的页面,确认页面是否可访问、内容是否正常,排除基准本身失效的情况。

如果条目量很大,可以先用抽样:随机抽取若干页,逐页比对。抽样能快速判断遗漏是否存在,但要判断遗漏比例,仍需覆盖足够多的页。差集结果要保留原始链接和采集时间,方便后续复查。

验证阶段:区分“真遗漏”和“假遗漏”

差集里的条目不一定都是采集遗漏,常见解释有几种,需要分别核实:

验证时优先看采集日志:请求是否发出、返回状态是什么、解析到了多少条、入库多少条。日志能区分“没请求到”和“请求到但没解析出来”。如果日志缺失,就手动请求疑似遗漏的页面,对比返回内容和解析规则,判断问题出在请求层还是解析层。

维护阶段:把遗漏检查变成固定动作

一次性诊断只能解决当前问题。要持续判断采集是否遗漏,可以把检查固化成几个动作:

判断标准可以设为:差集条目经复查后仍无法从采集结果中找到,且页面可正常访问,就按真实遗漏处理;如果差集条目在复查中消失或页面失效,则从遗漏清单中移除。这样维护下来的记录,比单次数量对比更能说明采集质量。

下一步,选一个你正在维护的分类或列表,按上面的步骤做一次抽样差集,把结果和采集日志放在一起核对,先确认遗漏发生在请求、解析还是入库环节。

图1 图2

nginx