大型语言模型的多对多摘要实证研究
计算与语言
2025-05-20 v1 人工智能
摘要
多对多摘要 (M2MS) 旨在处理任意语言的文档并生成对应的任意语言摘要。最近,大型语言模型 (LLM) 显示出强大的多语言能力,使其有潜力在实际应用中执行 M2MS。本工作提出了 LLMs M2MS 能力的系统实证研究。具体而言,我们基于八个之前的 domain-specific 数据集重新组织 M2MS 数据。重新组织后的数据包含 47.8K 样本,涵盖五个领域和六种语言,可用于训练和评估 LLMs。随后,我们零样本和 instruction-tuning 方式对 18 个 LLM 进行基准测试。还对 fine-tuned 传统模型(如 mBART)进行对比。我们的实验表明,零样本 LLM 能与 fine-tuned 传统模型保持竞争力。经过 instruction-tuning 后,开源 LLM 可显著提升其 M2MS 能力,在自动评估方面超越零样本 LLM(包括 GPT-4)。此外,我们证明了此 task-specific 改进并不牺牲 LLMs 的 general task-solving 能力。然而,正如我们通过 human evaluation 所揭示的,LLM 仍面临事实性问题,且 instruction tuning 可能加剧这一问题。因此,如何控制事实性错误成为构建 LLM summarizer 在实际应用中的关键问题,也值得在未来研究中重点关注。
引用
@article{arxiv.2505.12983,
title = {An Empirical Study of Many-to-Many Summarization with Large Language Models},
author = {Jiaan Wang and Fandong Meng and Zengkui Sun and Yunlong Liang and Yuxuan Cao and Jiarong Xu and Haoxiang Shi and Jie Zhou},
journal= {arXiv preprint arXiv:2505.12983},
year = {2025}
}
备注
Accepted to ACL 2025 main conference