先给结论:少量导入时,靠文件名与标题的肉眼对应通常够用;一旦批量导入且文件名被清洗、截断或重命名,这种对应就会失效。此时应放弃“文件名即标题”的假设,改用导入日志中的稳定标识做核对锚点,再决定是回滚重导还是逐条修正。
单篇导入时,文件名往往保留完整标题,肉眼扫一眼就能确认。但批量导入工具常按固定长度截断文件名,或把空格、标点替换成连字符,甚至直接改用序号命名。原文件与页面标题之间的文字关联随之断开,错位就从“个别异常”变成“成片出现”。
判断是否已进入失效区,可以看三个信号:文件名是否出现连续序号、标题字段是否被截断、导入清单里是否存在重复的临时名称。只要出现其中任意一个,就不能再靠文件名核对。
稳定标识指导入前后都不变的字段,例如源数据里的唯一编号、原始URL中的路径片段、或导入时写入的批次行号。把它与页面标题放进同一张核对清单,逐行比对,才能定位错位发生在哪一步。
如果导入工具没有写出源标识,就先补一次带标识的试导,再继续处理,否则后续修正没有参照。
假设源数据本身存在重复标识,例如同一编号被两个不同标题共用。此时按标识关联会把两篇内容都指向同一行,核对结果看似匹配,实际仍是错位。这种情况下,标识并不唯一,需要先回到源数据去重,再重新导入。
另一个反例是导入过程中标题被自动翻译或改写。若目标标题已不是源标题,任何基于文字相似度的比对都会失真,只能依赖源标识。
先抽十条错位记录,核对源标识与目标标题的对应关系,确认错位是随机分布还是集中在某个批次。如果是集中分布,回滚该批次重导通常比逐条修正更可控;如果是随机分布,则逐条修正并记录原因,避免再次触发。
修正后不要只看“标题看起来对了”。要重新跑一次关联核对,确认无法匹配的行数降为零,并保留前后两份清单作比较。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能把某次核对通过直接等同于长期稳定。
把稳定标识写进下一次导入的必填字段,并在导入后立即执行关联核对,而不是等到页面被访问或收录出现异常才回头排查。这样错位会在进入下一环节前暴露,修正成本最低。