基于排序而非计分:面向 LLM 生成医学解释性论点的可靠性与鲁棒性自动评估
计算与语言
2024-10-01 v1
摘要
评估 LLM 生成的文本已成为一个关键挑战,尤其是在医学等特定领域。本工作引入一种新颖的评估方法,用于评估 LLM 生成的医学解释性论点,依赖于代理任务和排序机制,以更贴近人类评估标准,克服通常在 LLM 作为评判者中看到的偏见。我们展示了所提出的评估器对对抗性攻击具有鲁棒性,包括对非论证性文本的评估。此外,训练评估器所需的人类精心构建的论证仅需每个代理任务一个示例。通过审查多个 LLM 生成的论证,我们建立了一种确定性代理任务是否适合评估 LLM 生成的医学解释性论点的 методology,仅需五个示例和两个人类专家。
引用
@article{arxiv.2409.20565,
title = {Ranking Over Scoring: Towards Reliable and Robust Automated Evaluation of LLM-Generated Medical Explanatory Arguments},
author = {Iker De la Iglesia and Iakes Goenaga and Johanna Ramirez-Romero and Jose Maria Villa-Gonzalez and Josu Goikoetxea and Ander Barrena},
journal= {arXiv preprint arXiv:2409.20565},
year = {2024}
}