中文

关注这个,而非那个!通过自适应特征指定引导大语言模型

机器学习 2025-06-06 v4 人工智能 计算与语言

摘要

尽管指令微调(IT)在训练大语言模型(LLM)方面取得了成功,但此类模型通常会利用从训练数据中学到的虚假或有偏特征,并可能变得不对齐,从而导致不良行为。虽然现有技术可以在推理时引导模型行为,但它们通常是事后性的,并未将引导作为模型的内在特征。在这项工作中,我们引入了焦点指令微调(FIT),它训练LLM通过关注特定特征而忽略其他特征来调节其响应,从而根据指定的特征产生不同的行为。在多个基准测试中,我们证明FIT:(i)成功地在推理时引导行为;(ii)通过放大核心任务信号并降低虚假线索的权重来增强鲁棒性;(iii)通过抑制人口统计属性来减轻社会偏见;(iv)在分布偏移和未见过的焦点特征下具有良好的泛化能力。因此,FIT提供了一种轻量级的内在机制,用于构建更鲁棒、更公平且易于控制的LLM。

关键词

引用

@article{arxiv.2410.22944,
  title  = {Focus On This, Not That! Steering LLMs with Adaptive Feature Specification},
  author = {Tom A. Lamb and Adam Davies and Alasdair Paren and Philip H. S. Torr and Francesco Pinto},
  journal= {arXiv preprint arXiv:2410.22944},
  year   = {2025}
}

备注

36pages, 19 figures