先别急着重新导出。把手里这份文件当作待核对的“样本”,用总数、边界、顺序三条证据交叉检查,通常能判断是工具漏页、筛选条件截断,还是分页本身没有更多数据。只有确认漏页原因后,才决定是补导、改条件,还是换一种导出方式。
自动导出常见的反直觉结果是:文件行数变少,但工具界面仍显示有数据。此时先看导出文件的第一行和最后一行,再回到工具里查看同一条件下的记录总数或分页总数。如果工具显示的总数与文件行数接近,说明可能只是筛选条件不同;如果差距明显,才进入分页检查。
一个可执行动作是:把导出文件按时间或编号排序,找出最小值和最大值,再手动翻到工具中对应的第一页和最后一页,核对首尾记录是否一致。首尾一致但中间缺失,通常是分页抓取中断;首尾就不一致,更可能是筛选范围或排序方式在导出前后发生了变化。
不要只看行数。行数受空行、表头、合并单元格影响,单独归零或变少不能证明漏页。更可靠的做法是同时记录三个值:工具界面显示的总条数、导出文件的数据行数、按唯一编号去重后的条数。三者关系比单一数字更有解释力。
假设某次导出每页50条,工具显示总数320,文件只有270条,差值50正好是一页。此时先检查第6页首条是否在文件中;若不在,补导这一页即可,而不是全量重导。这个判断依赖“每页条数固定”这个前提,如果分页大小会变化,就要改用编号区间来定位。
检查的目的不是证明工具错了,而是决定下一步怎么做。根据上面三条证据,可以分成三种处理路径:
每次处理完,都要重新核对总数、边界和顺序。如果补导后总数仍对不上,但编号已连续,优先怀疑去重规则或表头行;如果编号仍跳号,则回到分页检查,而不是继续合并文件。
有几种情况会让文件看起来“少了”,但并不属于分页遗漏:导出时自动去除了重复记录、筛选条件在两次操作之间被改动、工具只导出当前可见列或当前页、文件被打开时截断了末尾空行。这些解释都能造成行数变化,不能只凭行数下结论。
区分方法是看唯一编号是否连续、首尾是否与工具一致、总数差值是否接近整页。若编号连续且首尾一致,即使行数比预期少,也更可能是去重或筛选导致;若编号出现整段缺失,才按漏页处理。把这个判断写进检查记录,下次遇到同类文件时可以快速复用,而不是每次从零猜测。
为了让下一次导出可比较,建议在文件旁边留一条简短记录:导出时间、筛选条件、排序字段、工具显示总数、文件行数、去重后条数、首尾编号、缺失区间、处理动作。这样当再次出现行数变化时,你能直接对比是条件变了还是分页断了。
如果多次导出都在同一页码附近缺失,优先检查该页附近是否有特殊字符、空值或超长字段;这些内容有时会影响抓取稳定性,但具体原因需要结合工具日志或导出记录核对,不能仅凭现象断定。把每次的缺失位置和条件记下来,比反复重导更能缩小问题范围。最终判断应以你能重复核对的证据为准,而不是以某一次行数多少为准。