当页面数、栏目数和改版频率同时上升,手工处理的瓶颈通常先出现在“发现与核对”环节:同一批 URL 在不同角色手里被反复检查,结论却不一致。此时应把可重复、可批量核对的工作交给规则或脚本,而把判断标准、异常归因和跨部门取舍保留给人。下面按“先给有条件结论、再给反例、最后给下一步动作”的顺序展开。
判断标准不是“难不难”,而是“输入是否稳定、判断是否可枚举、错误是否可回滚”。满足这三点的,手工做会随规模扩大而失控。
一个实际动作:把“URL 是否可访问”和“URL 是否应保留”拆成两张表。前者由脚本每天核对,后者由内容负责人每周确认一次。结果是异常清单不再混入“业务上已经决定删掉”的页面,人只需要处理真正需要判断的条目,下一步的优先级排序才有依据。
页面数到几百以上时,靠表格手工记录内链关系会出现两个问题:一是同一页面被多个角色以不同命名记录,二是删改页面后引用它的位置无法同步更新。这两点都会让“页面是否被抓取、是否被索引”的排查变成对账工作,而不是优化工作。
可区分的原因证据:如果同一批 URL 在两次核对中数量不一致,先查清单来源是否统一,而不是先怀疑抓取。抓取、索引、排名是不同环节,清单本身混乱时,后两个环节的结论都不可靠。
假设一个场景:某站点有约两千个内容页,运营用表格记录内链,技术用另一份配置记录跳转。改版后运营表里仍留着旧路径,技术配置已更新。此时脚本比对两份来源会报出大量“失效链接”,但真实失效的只有少数。这个例子用来说明:来源不统一时,自动化只会更快地放大分歧。数字仅用于说明比较方法,不代表任何真实站点。
多个角色对同一事实理解不同时,有效的做法是把分歧写成一条可验证的陈述,并指定核对方式。例如“这批页面没有被收录”应改写为“在指定日期抓取的 URL 集合中,有 N 条未出现在索引结果里”,并注明抓取时间、来源和核对人。
这样做的影响是:下一轮讨论的起点从“我觉得”变成“这条记录显示”,需要人工判断的范围会明显缩小。
如果站点规模虽大,但页面结构高度不统一、模板频繁临时改动、且没有稳定的 URL 命名约定,那么自动化核对会持续产出大量噪声,反而增加人工负担。此时更合理的顺序是先统一模板与命名规则,再逐步把核对工作交给脚本。
也就是说,“规模扩大就应减少手工”成立的前提是输入相对稳定。输入不稳定时,先做规范化,而不是先做自动化。请求量或抓取量下降也不能单独证明某项处理正确,它还可能来自改版、屏蔽规则调整或统计口径变化。
先选出当前最耗时的一项重复核对工作,统计它每周消耗的人时和出错次数;如果出错主要来自来源不统一而非判断困难,就把它列为第一个自动化对象,并同时指定唯一的清单来源。完成这一步后,再决定第二项工作是否值得同样处理。