中文

词语决定了域适应在概括总结中的影响?

计算与语言 2024-06-24 v1

摘要

域适应旨在使大型语言模型(LLMs)能够有效地推广到训练阶段未见的领域数据集。然而,模型参数规模和训练数据规模等因素是普遍的影响因素,无法反映域适应性能的细微差异。本文探讨了影响域适应性能的细粒度因素,分析了训练数据中`词语'对概括总结任务的具体影响。我们提出将数据集学习难度量化为生成式概括总结的学习难度,该难度由两个指标决定:基于词语的压缩率和抽象程度。我们的实验得出结论:在考虑数据集学习难度时,跨域重叠度和概括总结任务的性能提升呈近似线性关系,这与词语数量无直接关联。基于此 finding,我们可以在训练前预测模型在未知领域数据集上的性能。

关键词

引用

@article{arxiv.2406.14828,
  title  = {Word Matters: What Influences Domain Adaptation in Summarization?},
  author = {Yinghao Li and Siyu Miao and Heyan Huang and Yang Gao},
  journal= {arXiv preprint arXiv:2406.14828},
  year   = {2024}
}