中文

PolyFrame at MWE-2026 AdMIRe 2:当单词不够时——多模态习语歧义消解

计算与语言 2026-03-17 v2

摘要

多模态模型在处理因其非组成性意义而导致的习语表达时面临挑战,这一挑战在多语言环境下尤为突出。我们介绍了 PolyFrame——我们为 MWE-2026 AdMIRe2 共享任务开发的系统,该系统为图像+文本排序 (子任务 A) 和文本-only 标题排序 (子任务 B) 提供统一的管道。所有模型变体保留冻结的 CLIP 风格视觉-语言编码器和多语言 BGE M3 编码器,仅训练轻量模块:逻辑回归和基于 LLM 的句子类型预测器、习语同义词替换、带干扰项感知的评分以及 Borda 秩融合。从 CLIP 基线 (英语 dev 上 Top-1 为 26.7%,英语 test 上为 6.7%) 开始,加入习语感知的改写和显式句子类型分类后,性能提升至英语 Top-1 为 60.0%,并在葡萄牙语零样本迁移中实现 60.0% Top-1 (0.822 NDCG@5)。在多语言盲测测试中,我们的系统在子任务 A 和子任务 B Across 15 种语言的平均 Top-1/NDCG 分别为 0.35/0.73 和 0.32/0.71。消融结果表明,习语感知的改写是性能提升的主要贡献者,而句子类型预测和多模态融合则增强了鲁棒性。这些发现表明,在不对大型多模态编码器进行微调的情况下,实现有效的习语消解是可行的。

关键词

引用

@article{arxiv.2602.18652,
  title  = {PolyFrame at MWE-2026 AdMIRe 2: When Words Are Not Enough: Multimodal Idiom Disambiguation},
  author = {Nina Hosseini-Kivanani},
  journal= {arXiv preprint arXiv:2602.18652},
  year   = {2026}
}

备注

Accepted at AdMIRe 2 shared task (Advancing Multimodal Idiomaticity Representation) colocated with 22nd Workshop on Multiword Expressions (MWE 2026) @EACL2026