中文

AI 助手能知道它们不知道什么吗?

计算与语言 2024-01-30 v2 人工智能

摘要

最近,基于大型语言模型(LLM)的 AI 助手在许多任务中表现出惊人的性能,例如对话、解决数学问题、编写代码和使用工具。尽管 LLM 拥有丰富的世界知识,但在面对一些知识密集型任务(如开放域问答)时仍然会犯事实性错误。AI 助手这些不真实的回复在实际应用中可能会造成重大风险。我们认为,AI 助手拒绝回答它不知道的问题是减少幻觉并使其值得信赖的关键方法。因此,在本文中,我们提出问题:“AI 助手能知道它们不知道什么并通过自然语言表达出来吗?”为了回答这个问题,我们基于现有的开放域问答数据集,为助手构建了一个特定于模型的“我不知道”(Idk)数据集,其中包含其已知和未知的问题。然后,我们将助手与其对应的 Idk 数据集进行对齐,并观察其在对齐后是否能拒绝回答未知问题。实验结果表明,在与 Idk 数据集对齐后,助手能够拒绝回答大多数未知问题。对于其尝试回答的问题,准确率显著高于对齐前。

关键词

引用

@article{arxiv.2401.13275,
  title  = {Can AI Assistants Know What They Don't Know?},
  author = {Qinyuan Cheng and Tianxiang Sun and Xiangyang Liu and Wenwei Zhang and Zhangyue Yin and Shimin Li and Linyang Li and Zhengfu He and Kai Chen and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2401.13275},
  year   = {2024}
}

备注

Work in progress