中文

Baichuan2-Sum:面向对话摘要的指令微调百川2-7B模型

计算与语言 2024-04-05 v3 人工智能 机器学习

摘要

诸如Llama、百川和Bloom等大语言模型(LLMs)通过指令微调在许多自然语言任务中展现出卓越的能力。然而,对于旨在为对话中不同角色生成摘要的对话摘要任务,大多数最先进的方法都是在小型模型(如Bart和Bert)上进行的。现有方法尝试在小型模型上添加特定任务的优化,例如向模型添加全局-局部中心性得分。在本文中,我们提出了一个面向角色的对话摘要指令微调模型:Baichuan2-Sum。通过为不同角色设置不同的指令,该模型能够从对话交互中学习并输出预期的摘要。此外,我们应用了NEFTune技术在训练过程中添加适当的噪声以改善结果。实验表明,所提出的模型在两个公开对话摘要数据集CSDS和SAMSUM上取得了新的最先进结果。我们发布了模型和相关代码,以促进对话摘要任务的未来研究。

关键词

引用

@article{arxiv.2401.15496,
  title  = {Baichuan2-Sum: Instruction Finetune Baichuan2-7B Model for Dialogue Summarization},
  author = {Jianfei Xiao and Yancan Chen and Yimin Ou and Hanyi Yu and Kai Shu and Yiyong Xiao},
  journal= {arXiv preprint arXiv:2401.15496},
  year   = {2024}
}