面向少样本对话摘要的 LLM 对话合成与摘要能力相互增强
计算与语言
2025-02-25 v1 人工智能
机器学习
摘要
在本工作中,我们在 LLM 内部提出了相互增强数据合成(Mutual Reinforcing Data Synthesis, MRDS),以改进少样本对话摘要任务。与以往需要外部知识的方法不同,我们相互增强 LLM 的对话合成与摘要能力,使它们在训练过程中相互补充并提升整体性能。对话合成能力通过利用来自摘要能力的偏好评分进行直接偏好优化来增强。摘要能力则通过对话合成能力产生的额外高质量对话-摘要配对数据来增强。通过利用所提出的 MRDS 机制,我们以合成数据的格式引导出 LLM 的内部知识,并用其增强少样本真实训练数据集。实证结果表明,我们的方法改进了对话摘要,在少样本设置下 ROUGE 得分提高了 1.5%,BERT 得分提高了 0.3%。此外,我们的方法在人工评估中获得了最高平均分,超越了预训练模型和仅针对摘要任务微调的基线模型。
引用
@article{arxiv.2502.17328,
title = {Mutual Reinforcement of LLM Dialogue Synthesis and Summarization Capabilities for Few-Shot Dialogue Summarization},
author = {Yen-Ju Lu and Ting-Yao Hu and Hema Swetha Koppula and Hadi Pouransari and Jen-Hao Rick Chang and Yin Xia and Xiang Kong and Qi Zhu and Simon Wang and Oncel Tuzel and Raviteja Vemulapalli},
journal= {arXiv preprint arXiv:2502.17328},
year = {2025}
}
备注
NAACL 2025 Findings