先看一个常见矛盾:同一批页面里,新手按一套固定检查项逐条打勾,少数样本看起来完全说得通;资深人员却先问这批页面的共同前提是否成立。两种诊断都可能对,但只有把“样本内成立”与“规模化后仍成立”分开,才知道该信哪一份结论。
假设一个学习小组拿十个页面做诊断练习。新手发现其中三个页面标题偏短、内链偏少,调整后这三个页面的抓取和展现确有变化,于是把“标题加长、补内链”写成通用规则。资深人员看到同一组数据,先追问:这三个页面是否本来就处于更容易被抓取的位置?其余七个页面是否因为模板、栏目层级或内容类型不同,根本不具备同样条件?
这里的关键不是谁更聪明,而是两种诊断的证据范围不同。新手证据来自少量可观察样本,资深人员证据来自对样本边界的追问。样本内成立,不等于换一批页面仍成立。
对上述现象至少有两种合理解释。
两种解释都能解释“三个页面变好了”,所以不能只凭结果反推原因。若直接把结论搬到全站,规模化后出现例外几乎是必然的。
要区分这两种解释,需要补三类证据。
一个可操作的动作是:让新手和资深人员各自写下“我认为这条规则适用的页面范围”,再随机抽取范围内和范围外的页面各若干,按同一观察周期记录。结果若显示范围内页面变化一致、范围外页面无变化,说明边界判断有价值;若两组都出现类似变化,则要重新怀疑最初的因果解释。
新人与资深人员的分歧,往往不是结论对错,而是证据层级不同。新手更擅长列出可检查项,资深人员更擅长追问前提和例外。把两者放进同一张记录里,比争论谁的方法更专业更有用。
记录至少包含四列:观察到的现象、当时的假设、做了什么动作、动作之后出现了什么变化。每列都写事实,不写“感觉变好了”这类判断。若论坛里的讨论只给出结论而没有过程,可以按这套结构向发帖人追问;若对方无法补充对照组或时间顺序,就把该结论暂定为待验证,而不是直接照搬。
评估论坛资料时也同理:先看它是否说明了样本条件、动作和观察周期,再看它是否把个别样本的结论直接扩大为通用规则。缺少这些信息的帖子仍可提供线索,但不适合当作规模化操作的依据。
可以照搬的条件通常包括:页面属于同一模板和内容类型,具备相近的抓取入口,调整动作可独立执行,并且有对照记录支持。必须重做诊断的情况则包括:页面来自不同栏目、依赖不同模板、更新节奏差异大,或变化与另一次改版同时发生。
假设一个学习小组把“补内链”从三个页面推广到三十个页面。若推广后只有原本就靠近入口的页面继续变化,其余页面没有变化,那么更合理的下一步不是加大内链数量,而是回到入口分布和栏目层级重新分组。这个假设说明的是比较方法,不代表任何真实项目的实际结果。
诊断差异并不可怕,可怕的是把样本内的巧合当成通用规律。先写边界,再补对照,最后才决定是否推广,这比记住任何一条固定检查项都更接近可复核的判断。