中文

CLAMBER:大语言模型中识别与澄清模糊信息需求的基准

计算与语言 2024-06-04 v2

摘要

大语言模型(LLM)越来越多地被用于满足用户的信息需求,但它们在处理包含各种类型模糊性的用户查询时的有效性仍然未知,最终会危及用户信任和满意度。为此,我们引入了 CLAMBER,一个使用结构良好的分类体系来评估 LLM 的基准。基于该分类体系,我们构建了约 12K 的高质量数据,以评估各种现成 LLM 的优势、劣势和潜在风险。我们的研究结果表明,当前的 LLM 在识别和澄清模糊用户查询方面的实际效用有限,即使通过思维链和少样本提示进行增强也是如此。这些技术可能导致 LLM 过度自信,并且在识别模糊性方面仅带来微小的提升。此外,由于缺乏冲突解决机制和对固有知识的不准确利用,当前的 LLM 在生成高质量澄清问题方面存在不足。在本文中,CLAMBER 提供了指导并促进了对主动且可信 LLM 的进一步研究。我们的数据集可在 https://github.com/zt991211/CLAMBER 获取

关键词

引用

@article{arxiv.2405.12063,
  title  = {CLAMBER: A Benchmark of Identifying and Clarifying Ambiguous Information Needs in Large Language Models},
  author = {Tong Zhang and Peixin Qin and Yang Deng and Chen Huang and Wenqiang Lei and Junhong Liu and Dingnan Jin and Hongru Liang and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2405.12063},
  year   = {2024}
}

备注

Accepted to ACL 2024. Camera Ready. Our dataset is available at https://github.com/zt991211/CLAMBER