中文

捷克句子嵌入的内在 vs. 外在评估:语义相关性对机器翻译评估没有帮助

计算与语言 2025-06-26 v1

摘要

本文通过内在和外在评估范式,对捷克专用句子嵌入模型和多语言句子嵌入模型进行比较。对于内在评估,我们采用Costra这一复杂句子转换数据集以及几个语义文本相似性(STS)基准测试,以评估嵌入模型捕捉语言现象(如语义相似性、时态 aspects、风格变体)的能力。在外在评估中,我们使用基于COMET的指标对每个嵌入模型进行微调,以进行机器翻译评估。我们的实验揭示了一个有趣的矛盾现象:在语义相似性测试中表现优异的模型并不一定在下游翻译评估任务中表现出色。相反,看似过于平滑的嵌入空间经过微调后也能取得优异成绩。这些发现凸显了语义属性探针与下游任务之间复杂的关系,强调需要更多研究来探讨句子嵌入中的“可操作语义”,或更深入的下游任务数据集(本文重点是翻译评估)。

关键词

引用

@article{arxiv.2506.20203,
  title  = {Intrinsic vs. Extrinsic Evaluation of Czech Sentence Embeddings: Semantic Relevance Doesn't Help with MT Evaluation},
  author = {Petra Barančíková and Ondřej Bojar},
  journal= {arXiv preprint arXiv:2506.20203},
  year   = {2025}
}