ConCSE:统一对比学习与增强用于代码切换嵌入
计算与语言
2024-12-23 v2 人工智能
摘要
本文探讨了代码切换(Code-Switching, CS)现象,即两种语言在单个语 utterance 中的交织。存在明显的需要研究英文和韩语之间的 CS。我们指出,当前针对其他语言的 CS 的等价约束(Equivalence Constraint, EC)理论可能仅部分捕捉英文-韩语 CS 的复杂性,due to 两种语言内在语法差异。我们提出一种针对英文-韩语 CS 场景的新型 Koglish 数据集,以缓解此类挑战。首先,我们构建了 Koglish-GLUE 数据集,以展示 CS 数据集在各种任务中的重要性和需求。我们发现,不同基础多语言语言模型在训练单语数据集 versus CS 数据集时存在差异结果。受此启发,我们假设 SimCSE 在单语句子嵌入方面表现突出,但在 CS 场景中可能存在局限性。我们使用基于 CS 增强方法构建新型 Koglish-NLI(自然语言推理)数据集以验证这一点。基于此 CS 增强数据集 Koglish-NLI,我们提出一种用于代码切换嵌入的统一对比学习与增强方法 ConCSE,突出显示 CS 句子的语义。实验结果验证了所提出 ConCSE 在 Koglish-STS(语义文本相似性)任务上平均性能提升 1.77%。
引用
@article{arxiv.2409.00120,
title = {ConCSE: Unified Contrastive Learning and Augmentation for Code-Switched Embeddings},
author = {Jangyeong Jeon and Sangyeon Cho and Minuk Ma and Junyoung Kim},
journal= {arXiv preprint arXiv:2409.00120},
year = {2024}
}
备注
Accepted for oral presentation at ICPR 2024