LangFIR:基于随机标记过滤发现单语数据中的稀疏语言特定特征用于语言驾驶
计算与语言
2026-04-07 v1 人工智能
机器学习
摘要
大型语言模型 (LLM) 显示出强大的多语言能力,但可靠地控制其输出语言仍然困难。表示层驾驶通过在推理时向模型激活添加语言特定向量来解决此问题,但标识残差流中的语言特定方向往往依赖多语言或平行数据,而这类数据获取成本较高。稀疏自编码器 (SAE) 将残差激活分解为可解释、稀疏的特征方向,为这种搜索提供了自然的基底,但现有基于 SAE 的方法也面临相同的数据约束。我们引入 LangFIR (Language Feature Identification via Random-token Filtering),一种仅使用少量单语数据和随机标记序列发现语言特定 SAE 特征的方法。许多由目标语言输入持续激活的 SAE 特征并不编码语言身份。随机标记序列揭示这些语言无关特征,使 LangFIR 能够过滤它们,从而隔离出稀疏的语言特定特征集合。我们展示,这些特征极其稀疏,对其目标语言高度选择性,并且具有因果性:对特定语言进行方向性删除会仅针对该语言增加交叉熵损失。使用这些特征构建用于多语言生成控制的驾驶向量,LangFIR 在三个模型 (Gemma 3 1B、Gemma 3 4B 和 Llama 3.1 8B)、三个数据集和十二种目标语言上实现最佳平均 BLEU 准确率,净显著超过最强的单语基线方法,并超越依赖平行数据的各种方法。我们的结果表明,多语言 LLM 中的语言身份局限于稀疏特征方向集合,这些特征可通过单语数据发现。代码地址为 https://anonymous.4open.science/r/LangFIR-C0F5/。
引用
@article{arxiv.2604.03532,
title = {LangFIR: Discovering Sparse Language-Specific Features from Monolingual Data for Language Steering},
author = {Sing Hieng Wong and Hassan Sajjad and A. B. Siddique},
journal= {arXiv preprint arXiv:2604.03532},
year = {2026}
}
备注
Submitted to COLM 2026