中文

通过正交约束消除跨语言嵌入中的语义泄漏

计算与语言 2025-09-03 v2 人工智能

摘要

准确地对准跨语言句子嵌入是有效平行数据挖掘的关键。实现这一对齐的常见策略是对从多语言预训练模型中派生的句子嵌入进行语义与语言的解耦。然而,我们发现当前的解耦表示学习方法存在语义泄漏——我们提出的这一术语描述当大量语言特定信息意外泄漏到语义表示中的情况。这会阻碍语义和语言表示的有效解耦,使我们难以检索能够独特代表句子意义的嵌入。为解决这一挑战,我们提出了一种新训练目标,ORthogonAlity Constraint LEarning (ORACLE),用于强制执行语义嵌入和语言嵌入之间的正交性。ORACLE 基于两个组件:类内聚类和类间分离。通过在跨语言检索和语义文本相似性任务上的实验,我们展示了使用 ORACLE 目标进行训练后,有效减少了语义泄漏并增强了嵌入空间中的语义对齐。

关键词

引用

@article{arxiv.2409.15664,
  title  = {Mitigating Semantic Leakage in Cross-lingual Embeddings via Orthogonality Constraint},
  author = {Dayeon Ki and Cheonbok Park and Hyunjoong Kim},
  journal= {arXiv preprint arXiv:2409.15664},
  year   = {2025}
}

备注

ACL 2024 RepL4NLP Workshop