LLM在对话记录多问题问答中的准确性如何?
计算与语言
2025-09-29 v1
摘要
在长上下文中部署大型语言模型(LLM)进行问答(QA)是一项重大挑战。在工业场景中,这一过程往往受到高计算成本和延迟的阻碍,尤其是当必须基于相同上下文回答多个问题时。在本工作中,我们探讨了 LLM 基于相同对话上下文回答多个问题的能力。我们进行了广泛的实验,并在这一具有挑战性的任务上对一系列专有和公开模型进行了基准测试。我们的发现表明,尽管像 GPT-4o 这样强大的专有 LLM 取得了最佳的整体性能,但经过微调的、参数量最高达80亿的公开 LLM 在准确率上可以超越 GPT-4o,这证明了它们在实际应用中实现透明且高性价比部署的潜力。
引用
@article{arxiv.2509.21732,
title = {How Accurate Are LLMs at Multi-Question Answering on Conversational Transcripts?},
author = {Xiliang Zhu and Shi Zong and David Rossouw},
journal= {arXiv preprint arXiv:2509.21732},
year = {2025}
}
备注
Accepted by EMNLP 2025 Industry Track