我可以问的:重新表述不可解问题
计算与语言
2024-07-25 v1 人工智能
摘要
在寻求不熟悉文档信息时,用户经常提出无法被文档解答的问题。虽然现有大型语言模型(LLM)识别这些不可解问题,但并不帮助用户重新表述问题,从而降低了整体实用性。我们策划了CouldAsk,一个由现有和新数据集组成的评估基准,专为研究重新表述不可解问题而设计。我们在CouldAsk上评估了最先进的开源和专有LLM。结果表明,这些模型在重新表述问题方面能力有限。具体而言,GPT-4和Llama2-7B分别成功重新表述问题的比例为26%和12%。错误分析显示,62%的未成功重新表述源于模型仅重新表述问题或甚至生成相同问题。我们公开发布基准及可复现实验的代码。
引用
@article{arxiv.2407.17469,
title = {I Could've Asked That: Reformulating Unanswerable Questions},
author = {Wenting Zhao and Ge Gao and Claire Cardie and Alexander M. Rush},
journal= {arXiv preprint arXiv:2407.17469},
year = {2024}
}