文本去重工具
按行去重,支持保留首次出现、保留末次出现、仅合并连续重复行三种模式。 可选大小写敏感、去除行首尾空白、去除空行、去重后排序。 实时统计原始行数、去重后行数、重复行数与重复率。适用于日志去重、 邮件列表清洗、数据导出去重、代码片段去重等场景。所有处理在浏览器本地完成。
常见问题
保留首次出现和保留末次出现有什么区别?
保留首次出现:当遇到重复行时,保留它在文本中第一次出现的位置,
后续重复行被删除。适合保持原始数据的出现顺序。
保留末次出现:当遇到重复行时,保留它最后一次出现的位置,
之前的重复行被删除。适合需要使用最新数据的场景(如日志中同一条目的最后状态)。
两种模式均保持行在文本中的相对顺序,去重后不改变非重复行的先后关系。
仅合并连续重复行是什么意思?
该模式只合并相邻的重复行,不相邻的重复行会被保留。 例如输入"A, B, A"(每行一条),结果仍为"A, B, A"(无相邻重复), 而输入"A, A, B"则结果为"A, B"。适合处理连续重复的日志行或数据行, 保留原始数据的完整结构。
大小写敏感选项有什么作用?
开启大小写敏感时,"Apple"和"apple"被视为不同的行,不会被去重。 关闭时,它们被视为重复行(比较时统一转为小写)。关闭大小写敏感 适合处理用户输入数据、邮箱地址等不区分大小写的场景。
去重后排序选项有什么作用?
开启后,去重结果按字母 / Unicode 码点顺序排序,便于查看和比对。 关闭后,保持去重后的原始出现顺序。注意:排序使用 JavaScript 原生 sort 方法,按 UTF-16 码点比较,中文按 Unicode 顺序排列。
这个工具适合哪些使用场景?
① 日志去重:合并重复的日志行,聚焦关键信息; ② 邮件列表清洗:去除重复的邮箱地址; ③ 数据导出去重:清理 CSV / TSV 导出数据中的重复行; ④ 代码片段去重:去除重复的 import 语句或配置项; ⑤ SEO 关键词去重:清理重复的关键词列表。
数据会上传到服务器吗?
不会。本工具完全在浏览器内运行,所有去重处理由 JavaScript 在你本地执行, 不会发送任何输入文本或去重结果到服务器。全程零网络请求,可离线使用。