网站规模扩大后,最先应该停止手工做的是“逐条查看页面并据此决定下一步”的工作,尤其是全站抓取与索引状态巡检、内链增删、结构化数据补写和推荐位内容筛选。判断标准不是工作量变大,而是手工结果无法稳定复现、无法留下可追溯记录,或者单个样本的结论不能代表整站。下面用两种不同条件说明哪些工作必须转为规则化处理,哪些仍可保留人工判断。
当站点由少量栏目扩展到大量同模板页面时,逐页打开检查标题、正文、内链和收录状态会迅速失去意义。手工巡检的典型问题是:今天查到的页面状态,明天可能因为模板调整、内容更新或抓取节奏变化而不同;不同人检查同一页面,也可能得出不同结论。此时更合理的动作是把巡检拆成两层:第一层用规则批量筛出异常,第二层只对异常样本做人工判断。
实际动作可以这样安排:先固定一组可批量获取的字段,例如页面地址、模板类型、最近一次抓取时间、是否被索引、页面主要内链数量。然后设定筛选条件,只把“字段缺失、字段值明显偏离同模板多数页面”的页面送入人工队列。这个动作的结果会直接影响下一步:如果异常集中在某个模板,应优先修模板;如果异常分散在不同栏目,才需要逐个栏目排查。手工逐页看无法给出这种分布判断。
例外也要写清:如果站点只有几十个页面,或者每个页面都是独立策划、没有统一模板,逐页检查仍然成立。此时强行上规则,反而会把大量正常差异误判为异常。
百度搜索推荐相关场景中,内容进入推荐位或获得更多展现,往往依赖页面被理解、被索引以及内容本身与用户需求匹配。当站点内容由少数编辑产出、每天更新量有限时,人工挑选推荐内容可行;一旦更新量增加、来源包含转载、投稿、聚合或自动生成,人工筛选会出现两个问题:一是标准漂移,不同编辑对“值得推荐”的判断不一致;二是无法解释为什么某个页面被推荐而另一个相似页面没有。
此时应把筛选拆成“硬条件”和“人工复核”两部分。硬条件可以包括页面是否可正常访问、是否已有稳定标题和正文、是否与同批内容存在明显重复。人工复核只处理硬条件通过但仍有争议的页面。这个动作的结果是:推荐位的内容来源变得可解释,后续调整也有依据。如果硬条件通过率突然下降,说明问题可能出在内容生产环节,而不是推荐筛选环节。
不能直接照搬的边界是:如果站点内容量很小,或者推荐位本身承担品牌表达、专题策划等无法规则化的目标,人工筛选仍然必要。规则只能替代重复判断,不能替代编辑意图。
不是所有工作都适合规则化。以下情况保留人工更合理:
这些工作的共同点是:判断依赖上下文,且结果无法仅靠字段值区分。把它们交给规则,容易产生看似一致、实际错误的结论。
假设某站点有五千个同模板页面,其中三百个页面在批量检查中显示“最近一次抓取时间明显早于同模板其他页面”。手工方式下,编辑可能随机打开其中二十个页面,发现其中几个内容较短,于是得出“内容短导致抓取减少”的结论。但这个结论不能直接成立,因为抓取减少还可能由内链不足、页面重复、服务器响应波动或模板调整引起。
规则化方式下,先把三百个页面按栏目、内链数量、内容长度分组,再对比同组正常页面。如果异常集中在某个内链较少的栏目,下一步应优先补内链或调整栏目入口;如果异常分散且没有明显共同字段,才需要回到内容质量或抓取日志排查。这个例子的重点不是数字,而是说明:手工样本可以提示方向,但不能单独证明原因。
在把任何工作转为规则化之前,先做一个可复现的检查:让两个人分别按同一标准处理同一批页面,记录结论是否一致。如果两人结论差异明显,说明这项工作的判断标准还没有稳定到可以手工规模化。下一步应先把标准写成可执行条件,再决定哪些条件可以批量执行、哪些必须保留人工。
这个动作的结果会影响后续投入:标准越清晰,越适合交给规则;标准越依赖上下文,越应该保留人工并缩小处理范围。网站规模扩大后,真正需要停止的不是所有手工,而是那些无法复现、无法追溯、也无法解释下一步动作的手工判断。