GPT 模型能否遵循人类摘要指南?一项面向目标沟通意图的研究
计算与语言
2025-10-07 v3 人工智能
摘要
本研究考察了 GPT 模型(ChatGPT、GPT-4 和 GPT-4o)生成遵循人类指南的对话摘要的能力。我们的评估涉及在 DialogSum(英语社交对话)和 DECODA(法语呼叫中心交互)两个数据集上尝试不同提示以引导模型遵循指南。基于摘要指南的人工评估作为主要评估方法,并辅以广泛的定量与定性分析。我们的发现显示,相较于任务特定的预训练模型摘要和参考摘要,人类更偏好 GPT 生成的摘要,这凸显了 GPT 模型遵循人类指南的能力,尽管其偶尔会产生更长的输出,并与参考摘要在词汇和结构上呈现差异对齐。ROUGE、BERTScore 与人工评估之间的不一致强调了开发更可靠自动评估指标的必要性。
引用
@article{arxiv.2310.16810,
title = {Can GPT models Follow Human Summarization Guidelines? A Study for Targeted Communication Goals},
author = {Yongxin Zhou and Fabien Ringeval and François Portet},
journal= {arXiv preprint arXiv:2310.16810},
year = {2025}
}
备注
INLG 2025, Hanoi, Vietnam, October 29 - November 2, 2025