中文

倾听少数智者:选择-复制注意力头用于多选问答

计算与语言 2024-10-04 v1 机器学习

摘要

评估大语言模型(LLM)能力的标准方法是呈现多选问题并选择最高logit作为模型预测的答案。然而,这种评估格式存在局限性,即使模型知道正确答案,也可能由于难以遵循这种刚性格式而无法选择相应的字母。为此,我们引入新的评分方法,以更好地捕捉和揭示模型的底层知识:查询-键得分(QK-score),源于注意力头中查询和键表示之间的相互作用,以及注意力得分,基于注意力权重。这些得分从特定的选择-复制注意力头中提取,这些头在流行的多选问答(MCQA)数据集上表现一致。基于这些得分,我们的方法提高了知识提取,在LLaMA2-7B上实现最高16%的提升,在更大模型上实现最高10%的提升,均在流行的MCQA基准测试中。同时,对一个简单的人工数据集的准确率提高了近60%,几乎达到完美准确率,从而证明了该方法在缓解MCQA格式局限性方面的高效性。为支持我们的主张,我们在从70亿参数的模型中进行了从70亿参数的模型实验,涵盖零样本和少样本设置。

关键词

引用

@article{arxiv.2410.02343,
  title  = {Listening to the Wise Few: Select-and-Copy Attention Heads for Multiple-Choice QA},
  author = {Eduard Tulchinskii and Laida Kushnareva and Kristian Kuznetsov and Anastasia Voznyuk and Andrei Andriiainen and Irina Piontkovskaya and Evgeny Burnaev and Serguei Barannikov},
  journal= {arXiv preprint arXiv:2410.02343},
  year   = {2024}
}