RephQA:评估大语言模型在公共卫生问答中的可读性
计算与语言
2025-10-06 v2
摘要
大语言模型(LLMs)在解决复杂医疗问题方面展现出潜力。然而,尽管先前大多数研究侧重于提高准确性和推理能力,但开发有效医疗智能体的一个显著瓶颈在于LLM生成回复的可读性,特别是它们能否清晰、简单地向无医学背景的人群回答公共卫生问题。在这项工作中,我们引入了RephQA,一个用于评估LLM在公共卫生问答(QA)中可读性的基准。它包含来自13个主题、27个来源的533个经专家评审的问答对,并包括一个用于评估信息量的代理多项选择任务,以及两个可读性指标:Flesch-Kincaid等级水平和专业评分。对25个LLM的评估显示,大多数未能达到可读性标准,凸显了推理能力与有效沟通之间的差距。为解决此问题,我们探索了四种可读性增强策略——标准提示、思维链提示、分组相对策略优化(GRPO)及其令牌自适应变体。令牌自适应的GRPO取得了最佳结果,推动了更实用、更用户友好的公共卫生智能体的发展。这些结果标志着向构建更实用的公共卫生智能体迈出了一步。
引用
@article{arxiv.2509.16360,
title = {RephQA: Evaluating Readability of Large Language Models in Public Health Question Answering},
author = {Weikang Qiu and Tinglin Huang and Ryan Rullo and Yucheng Kuang and Ali Maatouk and S. Raquel Ramos and Rex Ying},
journal= {arXiv preprint arXiv:2509.16360},
year = {2025}
}
备注
ACM KDD Health Track 2025 Blue Sky Best Paper