合并 · 剔除 · 验证 — 浏览器端本地处理,数据不上传服务器
| 数据文件 |
从 Web of Science 导出的 .txt 文件("纯文本"格式),每条记录以 PT 开头、ER 独占一行结尾。支持多个分段的 txt 文件,按文件名开头的数字序号自动排序合并(如 1-500.txt / 501-1000.txt / 1001-1410.txt)。 |
| 剔除列表 |
从 WoS 导出的 .xlsx(Excel 格式),表头只需包含一个名字带 "UT" 的列(例如 "UT (Unique WOS ID)"),列的位置、顺序不限。 程序通过该 UT 值与数据文件中的 UT WOS:xxxxxxxxx 行精确匹配。
|
模块1 · 合并:按文件名序号拼接多个 txt 文件,第一个文件保留 WoS 文件头(FN/VR),后续文件只取记录部分,末尾统一保留一个 EF 结束标记。
模块2 · 剔除:解析每一条记录中的 UT WOS:xxxxxxxxx 行,提取唯一标识符,与 Excel 剔除列表的 UT 列做精确字符串匹配。匹配成功的记录整体移除,不修改任何一行原始内容。
模块3 · 验证:执行 5 项自动检查——数量公式验证、UT 可溯源检查、剔除条目无泄漏检查、逐字节内容对比、输出结构完整性检查。
不需要。程序按列名文字模糊匹配,只要表头中包含 "UT" 两个字(如 "UT (Unique WOS ID)"、"UT"、"WOS UT"),不管该列在 A 列、W 列还是任意位置都能自动识别。
是的,单个 HTML 文件即可。不需要安装 Node.js、Python 或任何软件。唯一前提是首次打开时需要联网——浏览器会从 CDN 自动加载 Excel 解析库(约 500KB),加载后会缓存到本地,之后再打开即使断网也能正常使用。
不会。WoS 导出格式中,所有字段标签(PT、AU、TI、UT 等)都顶格写在行首,续行内容统一以 3 个空格缩进。只有行首且顶格的 PT 才会被识别为新记录起点,只有独占一行且顶格的 ER 才会被识别为记录结束。摘要或引用中的相同文字因缩进而不会被误判。
不会。本工具只做条目级别的添加(合并)和移除(剔除),保留的每一条记录都会通过"逐字节对比"验证,确保与原始数据完全一致——标点、换行、空格一个都不会改。
完全本地处理。所有文件读取、解析、匹配、输出均在浏览器内完成(JavaScript 本地运行),数据内容不会上传到任何服务器。唯一的网络请求是从 CDN 加载 xlsx 解析库本身(代码库,不是数据)。