TokenSmith:面向大规模语言模型训练与可解释性的数据编辑、搜索与检查工具
计算与语言
2025-10-02 v2
摘要
理解训练数据与模型行为在预训练过程中的关系至关重要,但现有工作流程使该过程笨拙、碎片化,且常常难以及早获取研究人员。我们 presented TokenSmith,这是一个开源库,用于交互式编辑、检查和分析用于 Megatron 风格预训练框架(如 GPT-NeoX、Megatron 和 NVIDIA NeMo)中数据的工具。TokenSmith 支持搜索、查看、导入、导出、检查和抽样等多种操作,所有操作均通过简洁的用户界面和模块化后端实现。它还能够在无需修改训练代码的前提下,对预训练数据进行结构化编辑,从而简化数据集的调试、验证和实验。TokenSmith 旨在作为现有大型语言模型预训练工作流程的即插即用组件,从而 democratizing 生产级数据工具的访问。TokenSmith 在 GitHub 上提供,附带文档、教程以及演示视频(可在 YouTube 上观看)。
引用
@article{arxiv.2507.19419,
title = {TokenSmith: Streamlining Data Editing, Search, and Inspection for Large-Scale Language Model Training and Interpretability},
author = {Mohammad Aflah Khan and Ameya Godbole and Johnny Tian-Zheng Wei and Ryan Wang and James Flemings and Krishna P. Gummadi and Willie Neiswanger and Robin Jia},
journal= {arXiv preprint arXiv:2507.19419},
year = {2025}
}