中文

寻找翻译开关:发现并利用 LLM 中的任务启动特征

计算与语言 2026-01-19 v1 人工智能

摘要

大型语言模型 (LLM) 经常表现出强大的翻译能力,即使没有进行特定任务的微调。然而,控制这种内在能力的内部机制在很大程度上仍然是不透明的。为了揭开这一过程的神秘面纱,我们利用稀疏自编码器 (SAE) 并引入了一个用于识别特定任务特征的新框架。我们的方法首先召回在翻译输入上频繁共激活的特征,然后使用基于 PCA 的一致性指标对它们进行功能连贯性过滤。该框架成功分离出一小部分**翻译启动**特征。因果干预表明,放大这些特征会引导模型进行正确翻译,而消融它们会诱发幻觉和偏离任务的输出,证实它们代表了模型内在翻译能力的核心组件。从分析走向应用,我们利用这种机制洞察提出了一种用于高效微调的新数据选择策略。具体来说,我们优先在**机制困难**样本上进行训练——这些样本未能自然激活翻译启动特征。实验表明,这种方法显著提高了数据效率并抑制了幻觉。此外,我们发现这些机制可以迁移到同系列的更大模型中。我们的工作不仅解码了 LLM 翻译机制的核心组件,还提供了利用模型内部机制来创建更鲁棒、更高效模型的蓝图。代码可在 https://github.com/flamewei123/AAAI26-translation-Initiation-Features 获取。

关键词

引用

@article{arxiv.2601.11019,
  title  = {Finding the Translation Switch: Discovering and Exploiting the Task-Initiation Features in LLMs},
  author = {Xinwei Wu and Heng Liu and Xiaohu Zhao and Yuqi Ren and Linlong Xu and Longyue Wang and Deyi Xiong and Weihua Luo and Kaifu Zhang},
  journal= {arXiv preprint arXiv:2601.11019},
  year   = {2026}
}

备注

Accepted by AAAI 2026