中文

CondAmbigQA:一个用于条件性模糊问答的基准与数据集

计算与语言 2025-09-12 v2

摘要

用户通常假设大型语言模型(LLMs)共享他们对上下文和意图的认知对齐,导致他们在问答(QA)中省略关键信息并产生模糊查询。基于错位假设的响应可能被视为幻觉。因此,识别可能的隐含假设在QA中至关重要。为了应对这一根本性挑战,我们提出了条件性模糊问答(CondAmbigQA),这是一个包含2000个模糊查询和条件感知评估指标的基准。我们的研究开创性地将“条件”作为显式上下文约束,通过基于检索的标注来解决QA任务中的歧义,其中检索到的维基百科片段有助于识别给定查询的可能解释并相应地标注答案。实验表明,在回答前考虑条件的模型将答案准确率提高了11.75%,当明确提供条件时,准确率额外提高了7.15%。这些结果突显了明显的幻觉可能源于固有的查询歧义而非模型失败,并证明了条件推理在QA中的有效性,为研究人员提供了严格评估的工具。

关键词

引用

@article{arxiv.2502.01523,
  title  = {CondAmbigQA: A Benchmark and Dataset for Conditional Ambiguous Question Answering},
  author = {Zongxi Li and Yang Li and Haoran Xie and S. Joe Qin},
  journal= {arXiv preprint arXiv:2502.01523},
  year   = {2025}
}

备注

Accepted by EMNLP 2025 (Main Conference)