先给结论:升级后评分变化,通常不是页面本身变坏或变好,而是规则集合、权重和判定阈值被重新组织。解释差异的正确做法,是拿同一个页面在旧规则和新规则下逐项对照命中项,而不是比较总分。下面以一个你手上的页面为对象,把差异拆成可执行的核对步骤。
总分不可比,是因为两次扫描的输入可能并不相同。先确认三件事:同一份页面快照、同一抓取时间点、同一响应内容。如果升级后重新抓取,页面上的广告位、统计脚本、CDN 注入内容都可能已经变化,这时分数差异里混进了内容差异。
可以把页面另存为本地文件,或用固定快照分别喂给新旧两版规则。只有当输入字节一致时,分数差异才归因于规则本身。这一步做完,你才能判断下一步是查规则还是查页面。
升级后的评分通常由若干条规则加权求和。差异只可能来自三种情况:新增了规则、删除了规则、同一规则的权重或阈值变了。分别记录旧版与新版命中的规则编号、命中位置和权重,做成两列对照。
对照完成后,你会得到一份差异清单。清单里若只有权重变化,页面处置优先级不变;若出现新增命中,才需要进入下一步人工复核。
一个常见误判是:升级后分数升高,就认为站点被重新挂马。合理的替代解释至少包括规则收紧、阈值下调、特征库扩充。反过来,分数下降也可能是规则被合并或某条规则被暂时停用,而不是威胁被清除。
判断方法是对可疑命中项做人工查看:定位到具体代码片段,确认它是否真的具备挂马特征,例如未授权的跳转、混淆脚本、异常外链。如果人工复核认为不构成风险,那这次分数变化属于规则口径问题,应在内部记录中标注,而不是直接触发清理动作。
假设某页面旧版规则命中两条,权重分别为 3 和 2,总分 5;新版把第一条权重提到 4,同时新增一条权重 1 的规则并命中,总分变成 7。假设两次扫描的页面快照完全一致,那么这 2 分差距全部来自规则调整,页面风险并未增加。此时正确的下一步是核对新增的那条规则命中位置,而不是按分数升高去删除脚本。
这个例子的意义在于:分数是规则输出的结果,不是风险的直接度量。只有把分数还原成命中项,才能决定是否采取动作。
单个样本上成立的解释,放到批量扫描里未必成立。批量场景中,同一规则对不同页面类型的敏感度不同:动态渲染页面、含大量第三方脚本的页面,更容易触发新增规则。因此不能把单页结论直接套用到全站。
可行做法是先按页面模板分组,每组抽少量样本做新旧对照,统计差异集中在哪些规则上。如果差异集中在少数规则,优先评估这些规则的适用边界;如果差异分散,则更可能是抓取内容变化导致。完成分组核对后,再决定是全量重扫还是只针对受影响模板复核。
最后提醒:具体工具的新旧规则说明、阈值定义和版本变更记录,需要以该工具自身的发布说明为准,本文不代为断言任何未核实的现行功能。