结论先说:当页面、栏目和模板开始成批出现,判断“该不该手工做”的标准不再是工作量,而是这项工作是否依赖单页的独特判断。凡是能由模板、数据源或规则稳定推导出的动作,手工做会在规模扩大后变成错误来源;凡是需要结合业务意图、内容取舍和例外处理的动作,手工仍然必要。下面按抓取、索引、排名三个环节拆开说。
把一项工作拆成三个问题:输入是否结构化、规则是否稳定、例外是否频繁。三个答案都是“是、是、否”,就适合交给脚本或规则;只要例外频繁出现,手工判断就不能省。比如给所有商品页统一补一段规格说明,输入来自表结构,规则稳定,例外少,手工逐页改只会制造遗漏和版本不一致。反过来,判断某个栏目是否该合并、某段内容是否该保留,依赖对用户意图的理解,这类工作手工做反而更稳。
这个标准也解释了为什么同一项工作在样本阶段成立、在规模化后失效。样本阶段页面少,人工能记住每一处差异;规模扩大后,页面之间的差异不再由人记住,而是由数据源和模板决定。此时继续手工,等于把系统性问题当成个别问题处理。
抓取环节手工最容易失效的是“逐页检查能否被正常访问”。页面少时,人工点开几个链接就能发现异常;页面成批出现后,真正的问题往往不在单个页面,而在模板输出、参数拼接、分页规则和内部链接结构。这些位置一旦出错,影响的是整批页面,手工逐个检查既覆盖不全,也无法区分“个别页面异常”和“整类页面异常”。
适合交给规则的动作包括:统一检查重要模板是否输出了可抓取的链接、分页和筛选参数是否产生了大量重复入口、站点地图是否覆盖了主要栏目。这里要说明一个边界:抓取量下降或某个统计归零,不能单独证明处理正确。它也可能来自抓取预算重新分配、内容更新节奏变化,或者只是统计口径调整。看到这类现象,下一步应该是对比不同模板和不同栏目的抓取分布,而不是直接下结论。
索引环节最容易被误判为“可以全自动”的地方,是页面是否该被收录。规模扩大后,常见的做法是用规则批量决定哪些页面进入索引、哪些页面设为不可索引。这个做法在条件成立时有效:页面类型清晰、内容重复度高、用户意图一致。例如同一商品的不同排序参数页,规则化处理通常比逐页判断更一致。
但有一个反例会让结论失效:当某个页面类型同时承载了不同的用户意图,批量规则就会误伤。假设一个栏目下既有“品牌汇总页”,又有“型号对比页”,前者适合保留并参与索引,后者可能只是筛选结果的组合。如果只按 URL 参数一刀切,可能把有价值的对比页也排除掉。此时手工判断仍然必要,但手工的对象不是每一页,而是先定义页面类型,再决定规则覆盖哪些类型、哪些类型保留人工复核。
实际动作可以这样安排:先导出该类型页面的样本,按内容差异和用户意图分成几组,再为每组写一条规则,最后只对规则无法覆盖的少数页面做人工处理。这样做的结果是,规则负责一致性,人工负责例外,下一步就能根据例外出现的频率判断规则是否需要调整。
排名环节涉及的是搜索引擎对页面的理解和用户对内容的满足程度,这两件事都不适合用批量替换来改善。规模扩大后,常见的错误是把标题、描述或正文里的某个词统一替换,期待整站表现变化。统一替换能解决一致性问题,但不能解决内容是否回应用户意图的问题。如果页面本身没有提供用户需要的信息,替换只会让页面看起来更整齐,不会改变它是否值得被推荐。
适合规模化的动作是:统一检查标题模板是否准确描述了页面内容、内链是否指向了相关页面、重复内容是否被合理归并。这些动作的结果会影响下一步:如果检查发现某类页面的标题与正文主题不一致,优先修模板;如果发现内链只指向首页和栏目页,优先补内容之间的关联路径。反过来,如果某类页面内容本身薄弱,批量调整标题不会改变它的实际价值,此时应该回到内容规划,而不是继续在页面上做替换。
假设一个网站有 200 个页面时,编辑可以逐页检查标题、描述和内链,并且记得住哪些页面是重点。当页面增加到 20000 个,同样的工作如果继续手工做,会出现三种结果:检查覆盖不全、修改标准前后不一致、重点页面被淹没在普通页面里。此时正确的做法不是“全部自动化”,而是把工作分成两层:模板输出和结构化数据交给规则,页面类型定义和例外判断保留人工。规则上线后,下一步不是停止观察,而是定期抽查规则覆盖的页面,看例外是否集中在某一类模板或某一批数据源上。
这个例子的数字只用于说明比较方法,不代表任何真实项目的规模或效果。它要表达的是:手工和规则的边界会随着规模移动,判断依据是这项工作是否依赖单页的独特判断,而不是它看起来是否繁琐。