词序列熵:面向自由形式医疗问答应用及更广泛领域的不确定性估计
计算与语言
2024-11-19 v2 人工智能
机器学习
摘要
不确定性估计对于安全关键的人机交互系统(特别是在医疗工程领域)的可靠性至关重要。然而,在开放式医疗问答 (QA) 任务中,尚未建立起针对自由形式答案的稳健且通用的不确定性度量;在这些任务中,生成不等性在用于不确定性量化 (UQ) 的生成集合中引入了大量无关词汇和序列,可能导致偏差。本文引入了词序列熵 (WSE),这是一种在词和序列级别校准不确定性的方法,同时考虑了语义相关性。WSE 以一种与大型语言模型 (LLMs) 在不确定性量化 (UQ) 期间的可靠性更紧密对齐的方式来量化不确定性。我们在五个自由形式医疗 QA 数据集上,利用七个流行的大型语言模型 (LLMs),将 WSE 与六种基线方法进行了比较。实验结果表明,在两种正确性评估标准下,WSE 在 UQ 方面表现出卓越的性能。此外,在现实世界的医疗 QA 应用中,通过采用由 WSE 识别为具有较低不确定性的响应作为最终答案,LLMs 的性能得到了显著提升(例如,在 COVID-QA 数据集上模型准确率提高了 6.36%),且无需任何额外的特定任务微调或架构修改。
引用
@article{arxiv.2402.14259,
title = {Word-Sequence Entropy: Towards Uncertainty Estimation in Free-Form Medical Question Answering Applications and Beyond},
author = {Zhiyuan Wang and Jinhao Duan and Chenxi Yuan and Qingyu Chen and Tianlong Chen and Yue Zhang and Ren Wang and Xiaoshuang Shi and Kaidi Xu},
journal= {arXiv preprint arXiv:2402.14259},
year = {2024}
}
备注
Accepted by Engineering Applications of Artificial Intelligence