中文

长度是文档级语义的诅咒亦是祝福

计算与语言 2023-10-26 v1 人工智能

摘要

近年来,对比学习(CL)被广泛用于从预训练语言模型中恢复句子与文档级编码能力。本文中,我们质疑基于 CL 的模型的长度泛化能力,即其对长度诱导语义偏移的脆弱性。我们不仅证实长度脆弱性是一个显著却被忽视的研究空白,而且能够设计仅依赖文档长度所提供的语义信号的无监督 CL 方法。我们首先推导长度攻击背后的理论基础,表明拉长文档会加剧 CL 已然带来的高文档内相似性。此外,我们发现 CL 所承诺的各向同性高度依赖于训练中所接触文本的长度范围。受这些发现启发,我们提出一个简单而通用的文档表示学习框架 LA(SER)3^{3}:用于语义鲁棒句子表示学习的长度无关自参照,在标准信息检索基准上取得了最先进的无监督性能。

关键词

引用

@article{arxiv.2310.16193,
  title  = {Length is a Curse and a Blessing for Document-level Semantics},
  author = {Chenghao Xiao and Yizhi Li and G Thomas Hudson and Chenghua Lin and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2310.16193},
  year   = {2023}
}

备注

Accepted at EMNLP 2023. Our code is publicly available at https://github.com/gowitheflow-1998/LA-SER-cubed