无需额外训练的检索后向注意力:通过重复增强大型语言模型的嵌入
计算与语言
2025-03-31 v2 机器学习
摘要
语言模型可以被视为将文本嵌入到欧几里得空间中的函数,其中嵌入向量的质量直接决定了模型性能,而训练此类神经网络涉及各种不确定性。本文侧重于通过一种简单且易于实现的方法,提高预训练语言模型在零样本设置下的性能。我们提出了一种新颖的后向注意力机制来增强上下文信息编码。在中文大规模文本嵌入基准(C-MTEB)上进行评估,我们的方法在多个任务上取得了显著提升,为推进零样本学习能力提供了有价值的见解。
引用
@article{arxiv.2502.20726,
title = {Retrieval Backward Attention without Additional Training: Enhance Embeddings of Large Language Models via Repetition},
author = {Yifei Duan and Raphael Shang and Deng Liang and Yongqiang Cai},
journal= {arXiv preprint arXiv:2502.20726},
year = {2025}
}