LLM 短式与长式答案事实对齐的离奇案例
计算与语言
2026-01-13 v3 人工智能
摘要
大型语言模型 (LLM) 能够正确回答“爱因斯坦出生于何时?”,却在撰写关于爱因斯坦生平时未能提供相同的日期,这揭示了模型在不同任务复杂度下访问事实知识的根本性不一致性。尽管模型在事实问答基准测试中显示出惊人的准确性,但简单查询与复杂查询之间的可靠性差距仍不被充分理解,削弱了其可信度。在本工作中,我们引入短长形式事实问答对齐评估框架 (SLAQ),该框架比较 LLM 对相同事实问题的回答:(a) 孤立回答 (短式) 与 (b) 集成到复杂查询中的回答 (长式)。我们检查了 16 个 LLM 及 600 个查询,发现短式与长式查询答案存在系统性对齐失效。我们进一步发现位置相关的准确性损失和动量效应, wherein 连续正确或错误的答案会产生自我强化的模式。通过机制性分析,我们发现对齐事实激活了重叠的模型内部表征,基于机制相似性的指标可实现最高 78% 的准确率预测短长答案对齐。我们的工作将查询复杂度下的事实一致性确立为 LLM 可信度的一个重要方面,并挑战了当前评估实践——这些实践隐含地假设简单事实查询的良好性能即意味着在更复杂知识寻求任务中的可靠性。
引用
@article{arxiv.2510.11218,
title = {The Curious Case of Factual (Mis)Alignment between LLMs' Short- and Long-Form Answers},
author = {Saad Obaid ul Islam and Anne Lauscher and Goran Glavaš},
journal= {arXiv preprint arXiv:2510.11218},
year = {2026}
}
备注
Code: https://github.com/WorldHellow/SLAQ/tree/main