概念Token:通过概念定义学习行为嵌入
计算与语言
2026-01-09 v1 人工智能
机器学习
摘要
我们提出了Concept Tokens,这是一种轻量级方法,它向预训练的LLM添加一个新的特殊token,并仅从目标概念的多个自然语言定义中学习其嵌入,其中概念的出现被替换为新token。LLM保持冻结状态,并使用标准的语言建模目标优化嵌入。我们在三种设置下评估了Concept Tokens。首先,我们研究了HotpotQA上闭卷问答中的幻觉,并发现了一种定向效应:否定幻觉token主要通过增加弃答来减少幻觉答案,而断言它则会增加幻觉并降低精确度。其次,我们诱导了重述,这是一种用于第二语言教学的教学反馈策略,并观察到了相同的定向效应。此外,与在上下文中提供完整定义语料库相比,concept tokens能更好地保持对其他指令的遵从性(例如,提出后续问题)。最后,我们进行了一项关于埃菲尔铁塔和虚构的“澳大利亚塔”的定性研究,以说明学习到的嵌入捕获了什么信息以及其局限性出现在哪里。总体而言,Concept Tokens提供了一种从定义中学习的紧凑控制信号,可以引导冻结LLM的行为。
引用
@article{arxiv.2601.04465,
title = {Concept Tokens: Learning Behavioral Embeddings Through Concept Definitions},
author = {Ignacio Sastre and Aiala Rosá},
journal= {arXiv preprint arXiv:2601.04465},
year = {2026}
}