中文

通过专业分离实现灵活可适应的摘要

计算与语言 2024-06-11 v1

摘要

优秀的摘要模型应具备灵活性——即处理多种领域内摘要任务的能力,以及适应性——即获取新知识并调整以应对未见的域外任务的能力。不同于通过参数扩张实现这一点的大型语言模型(LLM),本研究提出一种更高效的参数方法。我们的动机基于这样一种原则:捕获关键信息的通用摘要能力可以跨越不同任务进行共享,而特定领域的摘要能力则需要具有差异性并针对性地设计。具体地,本文提出了 MoeSumm—a Mixture-of-Expert Summarization(专家混合摘要)架构,该架构利用主专家获取通用摘要能力,并通过副专家有选择地协作以满足特定摘要任务需求。我们进一步提出了最大边际损失,以激励这种能力的分离。该模型对通用摘要能力和领域特定摘要能力的明确分离,使其在保持参数高效性的同时,具备显著的灵活性和适应性。MoeSumm 通过单一模型管理多个领域的摘要任务,利用共享的主专家和所选副专家来实现灵活性。它通过为域外少样本和零样本场景定制副专家,展现出适应性。11 个数据集上的实验结果表明,我们的模型在最新基线和 LLM 之间具有优势。我们还提供了 MoeSumm 中两种能力明确分离的统计和可视化证据(https://github.com/iriscxy/MoE_Summ)。

关键词

引用

@article{arxiv.2406.05360,
  title  = {Flexible and Adaptable Summarization via Expertise Separation},
  author = {Xiuying Chen and Mingzhe Li and Shen Gao and Xin Cheng and Qingqing Zhu and Rui Yan and Xin Gao and Xiangliang Zhang},
  journal= {arXiv preprint arXiv:2406.05360},
  year   = {2024}
}

备注

10 pages, 7 figures, published in SIGIR 2024