医学文本生成中的解码策略比较研究
计算与语言
2025-08-20 v1 人工智能
摘要
大型语言模型(LLM)依赖 various 解码策略来生成文本,这些选择显著影响输出质量。 在医疗领域,由于准确性至关重要,解码策略的影响尚未得到充分探索。 我们在五个开放性医学任务中进行研究,包括翻译、摘要、问答、对话和图像描述,评估了 11 种解码策略对 medically specialized 和 general-purpose LLM 的影响,不同模型规模。我们的结果显示,确定性策略通常优于随机策略:beam search 取得最高分数,而 {\eta} 和 top-k sampling 表现最差。较慢的解码方法往往产生更好的质量。更大的模型总体取得更高分数,但推理时间更长,且对解码鲁棒性不佳。意外的是,尽管医学 LLM 在其中两个任务中超过通用 LLM,但统计分析显示整体性能优势不明显,并揭示了对解码选择更敏感。我们进一步比较了多个评估指标,发现不同任务之间的相关性差异较大,MAUVE 与 BERTScore 和 ROUGE 之间一致性较弱,并且对解码策略更敏感。这些结果突显了在医疗应用中谨慎选择解码方法的重要性,因为其影响有时甚至超过模型选择本身。
关键词
引用
@article{arxiv.2508.13580,
title = {A Comparative Study of Decoding Strategies in Medical Text Generation},
author = {Oriana Presacan and Alireza Nik and Vajira Thambawita and Bogdan Ionescu and Michael Riegler},
journal= {arXiv preprint arXiv:2508.13580},
year = {2025}
}