文本数据蒸馏技术报告
机器学习
2025-12-04 v1
摘要
在视觉领域,数据蒸馏作为将大型数据集凝缩为能够在训练过程中产生类似结果的较小合成数据集的技术而涌现。尽管图像数据拥有广泛的蒸馿方法文献,但文本数据蒸馿的工作数量相对较少。文本数据蒸馏最初作为从视觉领域的努力的适应而兴起,由于该模态的特殊性成为障碍,后发展为独立的研究分支。Several 里程碑标志着该领域的发展,例如引入使用变换模型的方法、生成离散合成文本以及扩展至拥有超过10亿参数的解码器专用模型。尽管现代方法取得了重大进展,但该领域仍处于成熟阶段, benchmarking 标准化、克服文本离散性的方法、处理复杂任务以及提供实际应用的显性示例方面仍有提升空间。本报告综述了过去和近期在文本数据蒸馿方面的进展,概述了不同的蒸馿策略、关键贡献以及总体挑战。
引用
@article{arxiv.2512.03967,
title = {Technical Report on Text Dataset Distillation},
author = {Keith Ando Ogawa and Bruno Lopes Yamamoto and Lucas Lauton de Alcantara and Victor Zacarias and Edson Bollis and Lucas Pellicer and Rosimeire Pereira Costa and Anna Helena Reali Costa and Artur Jordao},
journal= {arXiv preprint arXiv:2512.03967},
year = {2025}
}