中文

PERCS:基于人物指导的可控医学摘要数据集

计算与语言 2025-12-04 v1

摘要

自动医学文本简化在提高健康素养方面发挥着关键作用,使复杂的医学研究更易于不同读者理解。然而,大多数现有资源假设单一的通用受众,忽略了不同用户群体在医学素养和信息需求方面的巨大差异。为此,我们引入PERCS(Persona-guided Controllable Summarization),这是一个由医学摘要及其针对四种人物(普通人、准医学生、非医学研究人员和医学专家)量身定制的摘要组成的数据集。这些人物代表不同的医学素养水平和信息需求,强调面向特定受众的摘要化的必要性。PERCS数据集中的每个摘要都由医生审核,以确保事实准确性和人物一致性,并采用详细的错误分类法。技术验证表明,不同人物在可读性、词汇和内容深度方面存在明显差异。本文描述了该数据集,还对四个大型语言模型在PERCS上进行基准测试,使用评估指标衡量全面性、可读性和忠实性,建立了未来研究的基准结果。该数据集、注释指南和评估材料已公开,以支持人物特定通信和可控医学摘要研究。

关键词

引用

@article{arxiv.2512.03340,
  title  = {PERCS: Persona-Guided Controllable Biomedical Summarization Dataset},
  author = {Rohan Charudatt Salvi and Chirag Chawla and Dhruv Jain and Swapnil Panigrahi and Md Shad Akhtar and Shweta Yadav},
  journal= {arXiv preprint arXiv:2512.03340},
  year   = {2025}
}

备注

9 pages, 4 figures, 6 tables