文本清洗四步:字符、空白、重复行与批量替换
从网页或表格复制来的文本常带多余空白、空行与重复项。本文给出「去字符—去空白—去重复—批量替换」的处理顺序与对应工具。
核心要点
- 清洗顺序是关键:先统一字符、再清理空白,最后去重。不先去掉行尾空格,「苹果」与「苹果 」会被当成两条不同记录。
- 去重前先排序可以让肉眼复核更省力,也能顺带发现肉眼漏看的近似条目。
- 多数文本清洗操作不可逆,处理重要内容前请保留一份原始副本。
从 PDF、网页、Excel 复制来的文本通常不干净:夹着不可见空格、多余空行、重复条目,甚至全角半角混排。手工逐行处理既慢又容易漏,按固定顺序走四步可以一次性清理干净。
四步处理流程
| 步骤 | 处理对象 | 工具 |
|---|---|---|
| 1. 统一字符 | 全角/半角、中英标点、繁简体 | 全角半角转换、繁体转简体 |
| 2. 清理空白 | 行首尾空格、连续空格、空行 | 去首尾空白、压缩多余空白、删除空行 |
| 3. 剔除重复 | 重复行、重复记录 | 整行去重、文本排序 |
| 4. 批量改写 | 统一前缀后缀、替换关键词 | 批量替换、批量加前后缀 |
为什么顺序重要
先清理空白再去重:"苹果" 与 "苹果 " 只差一个空格,不先 trim 就会当成两条不同记录保留下来。先去重再排序可以让最终结果更容易肉眼复核。
顺手可以做的检查
开始清洗前先留一份原始副本——多数清洗操作是不可逆的。
常见问题
去重和整行去重有什么区别?
整行去重以行为单位删除重复出现的整行内容,保留首次出现的位置;按字符去重则是把文本中所有重复出现的字符剔除,常用于统计而不是清洗句子。
为什么去重要先清理空白?
因为带空格与不带空格的两行在程序看来是两个不同的字符串。先去掉行尾多余空格、统一全角半角,才能让真正重复的条目被识别出来。
空行和纯空格行要分开处理吗?
要。删除空行通常只去掉完全没有任何字符的行,而只含空格或制表符的行需要另做处理。建议先压缩多余空白,再统一删除空行。
文本清洗后可以撤销吗?
不可以。多数清洗操作会覆盖原内容,建议在开始前先把原文另存一份,或先在少量样本上试跑确认效果。
最后更新:2026-09-19