中文

词序列熵:面向自由形式医疗问答应用及更广泛领域的不确定性估计

计算与语言 2024-11-19 v2 人工智能 机器学习

摘要

不确定性估计对于安全关键的人机交互系统(特别是在医疗工程领域)的可靠性至关重要。然而,在开放式医疗问答 (QA) 任务中,尚未建立起针对自由形式答案的稳健且通用的不确定性度量;在这些任务中,生成不等性在用于不确定性量化 (UQ) 的生成集合中引入了大量无关词汇和序列,可能导致偏差。本文引入了词序列熵 (WSE),这是一种在词和序列级别校准不确定性的方法,同时考虑了语义相关性。WSE 以一种与大型语言模型 (LLMs) 在不确定性量化 (UQ) 期间的可靠性更紧密对齐的方式来量化不确定性。我们在五个自由形式医疗 QA 数据集上,利用七个流行的大型语言模型 (LLMs),将 WSE 与六种基线方法进行了比较。实验结果表明,在两种正确性评估标准下,WSE 在 UQ 方面表现出卓越的性能。此外,在现实世界的医疗 QA 应用中,通过采用由 WSE 识别为具有较低不确定性的响应作为最终答案,LLMs 的性能得到了显著提升(例如,在 COVID-QA 数据集上模型准确率提高了 6.36%),且无需任何额外的特定任务微调或架构修改。

关键词

引用

@article{arxiv.2402.14259,
  title  = {Word-Sequence Entropy: Towards Uncertainty Estimation in Free-Form Medical Question Answering Applications and Beyond},
  author = {Zhiyuan Wang and Jinhao Duan and Chenxi Yuan and Qingyu Chen and Tianlong Chen and Yue Zhang and Ren Wang and Xiaoshuang Shi and Kaidi Xu},
  journal= {arXiv preprint arXiv:2402.14259},
  year   = {2024}
}

备注

Accepted by Engineering Applications of Artificial Intelligence