先给一个有条件的结论:当筛选、排序、分页、追踪等参数可以自由组合时,有效地址集合不应由“哪些参数允许出现”来定义,而应由“哪些地址能产生独立且稳定的内容价值”来定义。满足这个条件时,把有效集合写成可核对的规则,比逐个提交或逐个屏蔽更可控;一旦内容本身随参数实时变化、且变化对用户有真实意义,这条结论就会失效,需要改用另一套判定方式。
多角色对同一事实理解不同,通常出在把三件事混在一起:地址能不能被访问、地址值不值得被索引、地址是否已经被处理。参数组合无限增长时,这三件事会迅速分叉。运营看到的是可访问的筛选结果页,开发看到的是同一套模板渲染,SEO 看到的是大量近似地址。若用“允许哪些参数”来定义有效集合,规则会随业务加参数不断失效,因为新参数一上线,旧白名单就漏了。
更稳的定义方式是给每个地址一个可判定的身份:它是否对应一个可被独立描述的主题,是否有稳定的标题与主体内容,是否不依赖用户会话或临时状态。满足这三点的地址进入有效集合;只改变展示顺序、只附加来源标记、只切换同一结果的视图,则不进入。
要让不同角色对同一批地址得出相同判断,可以把争议落到三个字段上,而不是争论“该不该收录”。
这三个字段可以直接写进抓取日志或站点地图的核对表里。动作上,先抽取一批带参数的地址,按上述字段各打一次标;结果若显示大量地址只在顺序或来源上不同,下一步就应转向合并与规范化,而不是继续扩大提交范围。
假设某目录站有color、size、sort、page四类参数。若color=red与color=blue各自对应不同的商品集合,且标题能准确描述该集合,那么它们可以进入有效集合;若sort=price只是把同一集合重排,它就不应单独成为有效地址。这里的关键不是参数数量,而是参数是否切分出可独立描述的内容。
反例也很明确:如果筛选结果页的内容由实时库存或个性化推荐拼装,同一地址在不同时刻返回不同主体,那么“独立且稳定”这一前提不成立,前述定义随之失效。此时应先把这类地址排除在有效集合之外,再讨论是否需要为其中某些视图建立固定入口。
完成一轮字段标注后,通常会得到三类地址:应保留的独立内容地址、应合并的变体地址、应排除的临时地址。下一步不是立刻批量提交,而是先验证保留类地址是否真的能被独立描述。若一个地址无法写出与其它地址不同的标题和摘要,它大概率不属于有效集合。
同时要记住几个边界:robots.txt 的抓取限制不等于可靠的索引移除;站点地图不保证收录;不同搜索引擎对参数地址的支持情况须分别核查。把这些当作核对前提,而不是结论本身,才能让有效地址集合随业务变化仍可复核。