中文

超越重叠指标:为忠实的多角色对话摘要奖励推理与偏好

计算与语言 2026-04-29 v2 人工智能

摘要

多角色对话摘要需要对多个说话者之间的复杂交互进行建模,同时保留角色特定信息和事实一致性。然而,大多数现有方法优化诸如ROUGE和BERTScore之类的自动指标,这些指标偏向于对参考的表面模仿,而不是在忠实性或与人类偏好对齐方面的真正改进。我们提出了一种新颖的框架,将显式的认知风格推理与基于奖励的优化相结合,用于多角色对话摘要。我们的方法首先从大型教师模型中提炼结构化的推理轨迹(例如,逐步推理和中间反思),并将其用作辅助监督,通过分阶段监督微调来初始化推理感知的摘要器。然后,它应用具有双原则奖励的GRPO,该奖励混合了基于指标的信号和针对关键信息覆盖、隐式推理、事实忠实性和简洁性的人类对齐标准。在多语言多角色对话基准上的实验表明,我们的方法在ROUGE和BERTScore上匹配了强基线。具体来说,CSDS上的结果证实了框架在语义一致性方面的稳定性,而对SAMSum的深入分析则展示了在事实忠实性和基于模型的偏好对齐方面的明显改进。这些发现强调了推理感知和偏好感知训练对于可靠对话摘要的价值。检查点和数据集可在 https://huggingface.co/collections/NebulaPixel/summorchestra-multirole-summary 获取。

关键词

引用

@article{arxiv.2604.17188,
  title  = {Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization},
  author = {Xiaoyong Mei and Tingting Zuo and Da Chen and Guangyu Hu and Xiangyu Wen and Chao Duan and Mingyan Zhang and Fudan Zheng},
  journal= {arXiv preprint arXiv:2604.17188},
  year   = {2026}
}