中文

Struc-EMB:结构感知编码在语言嵌入中的潜力

机器学习 2025-10-13 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)生成的文本嵌入已成为众多应用的基础。然而,这些模型通常基于原始文本运作,忽略了丰富的结构信息(如超链接或引用),而这些信息在许多真实数据集中提供了关键上下文。本文提出并系统评估了一种通过将结构关系直接整合到 LLM 内部编码过程中来生成结构感知文本嵌入的新范式,而非依赖传统的事后聚合方法。我们研究了两种主要的过程内方法:顺序拼接与并行缓存。通过在检索、聚类、分类和推荐任务上的广泛零样本实验,我们证明结构感知方法始终优于纯文本基线和事后基线。我们的分析揭示了关键权衡:顺序拼接在噪声较多、中等长度的上下文中表现更优,而并行缓存能更有效地扩展至长、高信噪比的上下文,但更容易受到干扰物的影响。为应对噪声结构数据的挑战,我们还引入并验证了两种有效技术:上下文蒸馏与语义平衡。本工作提供了对过程内结构感知编码的首个全面分析,为构建更强大、上下文感知能力更强的嵌入模型提供了蓝图。

关键词

引用

@article{arxiv.2510.08774,
  title  = {Struc-EMB: The Potential of Structure-Aware Encoding in Language Embeddings},
  author = {Shikun Liu and Haoyu Wang and Mufei Li and Pan Li},
  journal= {arXiv preprint arXiv:2510.08774},
  year   = {2025}
}