结论先说:当筛选、排序、分页、追踪参数可以任意组合时,把“所有能返回200的地址”当作有效集合,基本等于把抓取预算交给随机数。更可操作的定义是:只把代表独立内容、且能被站内导航或规范链接指向的地址算作有效集合;其余参数组合归入“可抓取但不提交、不内链、不主动暴露”的一类。这个定义会直接改变你保留哪些页面、改写哪些规则、退出哪些提交。
参数组合无限增长,不代表内容也无限增长。区分的关键证据不是组合数量,而是同一批参数变化后,页面主体是否出现实质差异。
假设一个站点有颜色、尺码、材质三个筛选维度,每个维度各有若干取值,再叠加排序与分页。组合数量会迅速膨胀,但真正有检索价值的可能只是“单维度筛选+首页”以及“双维度中确有稳定结果的组合”。这里的关键动作是抽样:从参数组合中分层抽取若干地址,人工核对标题、主体内容、结果数量和与相邻组合的重叠度。抽样结果决定下一步是保留、改写还是退出,而不是先写规则再找理由。
保留的适用前提比较严格:该参数地址有独立的用户需求,内容与父级页面差异明显,并且你能为它提供稳定的入口。
具体依据可以看三点:一是该组合是否在站内搜索、外部链接或用户行为中反复出现;二是它的结果集合是否与父级页面有足够差异,而不是只换了排序;三是它能否被面包屑、筛选导航或专题页自然链接到。满足这些条件时,可以把它纳入有效集合,让它参与站点地图和内部链接体系。
保留之后要做的动作是给它一个明确的规范指向策略:要么自指规范,要么指向更完整的父级页面。这个动作的结果会直接影响后续判断——如果保留后它仍然只能靠参数拼接到达、没有任何内链,那么它更接近“可抓取但不必提交”的地址,应考虑降级而不是继续扩充。
改写适合这样一种情况:参数本身有业务价值,但组合方式不受控,导致地址集合无法收敛。
常见做法是把高频、稳定的筛选组合固化为静态或伪静态路径,把其余组合留给参数形式并限制其暴露。比如把“地区+品类”这种稳定组合写成独立入口,而把排序、视图切换、追踪参数留在查询串里,并确保这些变体不被站内链接大量扩散。
改写的判断依据是:固化后的地址是否有独立标题、独立描述和独立内容,而不是仅仅换了一个更干净的URL。如果只是换了路径形式,内容仍然与父级页面相同,那么改写并没有缩小有效集合,只是把问题从参数搬到了路径上。执行改写后,应重新核对旧参数地址与新入口的对应关系,确认旧地址是继续可访问、做规范指向,还是应当退出提交。这个结果决定你是否需要同步调整内链和站点地图,而不是一次性改完就结束。
退出的适用前提是:该地址不承载独立内容,或者其内容已被更完整的页面覆盖,且继续暴露只会增加抓取负担。
典型对象包括排序参数、每页条数、会话或追踪参数、空结果组合、以及由多个筛选维度随意叠加产生的地址。对这些地址,可行的动作是:不在站点地图中列出,不在站内导航中大量链接,必要时用robots.txt限制抓取。但要注意,robots.txt的抓取限制不等于可靠的索引移除;如果地址已经被外部链接指向,仅靠抓取限制并不能保证它从结果中消失。因此退出提交只是第一步,后续还要观察这些地址是否仍被引用、是否仍产生访问,再决定是否需要对已收录地址做进一步处理。
退出的结果会反过来影响保留集合:当大量低价值参数地址不再被提交和链接后,抓取资源会更集中到真正有独立内容的地址上。如果一段时间后你发现某些被退出的组合仍有稳定需求,那就说明它应该回到“改写”而不是继续留在退出清单里。
参数组合会持续变化,所以有效地址集合不能靠一次人工判断,而要靠可复核的规则。可以按下面顺序处理每个候选地址:
这份判定表的价值在于:它把“参数组合无限增长”从技术问题变成了取舍问题。你不需要为每一种组合给出答案,只需要为每一类组合给出可复核的归属。当归属规则稳定后,有效地址集合自然收敛,后续的提交、监测和调整才有明确对象。