什么才是好的查询?衡量人类易混淆语言特征对 LLM 性能的影响
计算与语言
2026-02-25 v1 人工智能
摘要
大型语言模型(LLM)幻觉通常被视为模型或其解码策略的缺陷。借助经典语言学,我们认为查询的形式也可能影响听者(以及模型)的响应。我们通过构建 22 维查询特征向量来实现这一洞见,涵盖从句复杂度、词汇稀有性以及指代、否定、可答性和意图 grounding 等已知影响人类理解的因素。我们使用 369,837 条真实世界查询提出问题:是否存在某些查询类型会导致更高的幻觉概率?大规模分析揭示了一致的“风险景观”:某些特征如深层从句嵌套和不完整表述与更高的幻觉倾向相关;相比之下,清晰的意图 grounding 和可答性与较低的幻觉率相关。其他特征,如领域特定性,显示出混合且取决于数据集和模型的效果。因此,这些发现建立了与幻觉风险相关的可观测查询特征表示,为引导查询改写和未来干预研究奠定了基础。
引用
@article{arxiv.2602.20300,
title = {What Makes a Good Query? Measuring the Impact of Human-Confusing Linguistic Features on LLM Performance},
author = {William Watson and Nicole Cho and Sumitra Ganesh and Manuela Veloso},
journal= {arXiv preprint arXiv:2602.20300},
year = {2026}
}
备注
EACL 2026 Findings