ssToken:面向 LLM 微调的自调制语义感知 Token 选择
人工智能
2025-10-22 v1
摘要
数据质量在增强大语言模型(LLM)的监督微调(SFT)中发挥关键作用,标记级数据选择因其细粒度特性而成为一种有前景的方向。尽管现有标记级选择方法在实证上表现优异,但存在两个关键局限:(1) 需要训练或访问额外参考模型,(2) 仅依赖损失信息进行标记选择,无法很好地保留那些虽不受损失指标青睐却语义重要的标记。为此,我们提出ssToken,即自调制(Self-modulated)和语义感知(Semantic-aware)Token选择方法。ssToken利用可及的历史模型计算当前模型与其之间的逐标记损失差异,该差异作为自调制信号,使模型能够在优化轨迹中自适应地选择标记,而非依赖先前方法中基于离线训练参考模型的额外损失。我们进一步引入基于注意力的语义感知标记重要性估计指标,与损失导向选择方法正交,为更有效的过滤提供补充语义信息。广泛实验表明,自调制选择和语义感知选择各自独立使用均优于完整数据微调,而两者集成-ssToken-实现协同收益,进一步超越先前的标记级选择方法,在保持训练效率的同时实现性能提升。
引用
@article{arxiv.2510.18250,
title = {ssToken: Self-modulated and Semantic-aware Token Selection for LLM Fine-tuning},
author = {Xiaohan Qin and Xiaoxing Wang and Ning Liao and Cancheng Zhang and Xiangdong Zhang and Mingquan Feng and Jingzhi Wang and Junchi Yan},
journal= {arXiv preprint arXiv:2510.18250},
year = {2025}
}