Claim2Vec:面向多语言相似性与聚类的辟谣声明嵌入
计算与语言
2026-04-16 v2
摘要
重复出现的声明对旨在打击错误信息的自动化事实核查系统构成了重大挑战,尤其是在多语言环境中。虽然声明匹配和已核查声明检索等任务旨在通过链接声明对来解决此问题,但通过声明聚类有效表示可通过同一事实核查解决的一组相似声明的更广泛挑战仍相对未被充分探索。为弥补这一空白,我们引入了Claim2Vec,这是首个优化的多语言嵌入模型,旨在将事实核查声明表示为改进语义嵌入空间中的向量。我们使用对比学习对多语言编码器进行微调,使用相似的多语言声明对。使用三个数据集、14个多语言嵌入模型和7种聚类算法在声明聚类任务上的实验表明,Claim2Vec显著提高了聚类性能。具体来说,它增强了不同聚类配置下的聚类标签对齐和嵌入空间的几何结构。我们的多语言分析表明,包含多种语言的聚类受益于微调,展示了跨语言知识迁移。
引用
@article{arxiv.2604.09812,
title = {Claim2Vec: Embedding Fact-Check Claims for Multilingual Similarity and Clustering},
author = {Rrubaa Panchendrarajan and Arkaitz Zubiaga},
journal= {arXiv preprint arXiv:2604.09812},
year = {2026}
}