长度是文档级语义的诅咒亦是祝福
计算与语言
2023-10-26 v1 人工智能
摘要
近年来,对比学习(CL)被广泛用于从预训练语言模型中恢复句子与文档级编码能力。本文中,我们质疑基于 CL 的模型的长度泛化能力,即其对长度诱导语义偏移的脆弱性。我们不仅证实长度脆弱性是一个显著却被忽视的研究空白,而且能够设计仅依赖文档长度所提供的语义信号的无监督 CL 方法。我们首先推导长度攻击背后的理论基础,表明拉长文档会加剧 CL 已然带来的高文档内相似性。此外,我们发现 CL 所承诺的各向同性高度依赖于训练中所接触文本的长度范围。受这些发现启发,我们提出一个简单而通用的文档表示学习框架 LA(SER):用于语义鲁棒句子表示学习的长度无关自参照,在标准信息检索基准上取得了最先进的无监督性能。
引用
@article{arxiv.2310.16193,
title = {Length is a Curse and a Blessing for Document-level Semantics},
author = {Chenghao Xiao and Yizhi Li and G Thomas Hudson and Chenghua Lin and Noura Al Moubayed},
journal= {arXiv preprint arXiv:2310.16193},
year = {2023}
}
备注
Accepted at EMNLP 2023. Our code is publicly available at https://github.com/gowitheflow-1998/LA-SER-cubed