理解多模态意义推断中歧义解决的路径
计算机视觉与模式识别
2025-10-14 v1 人工智能
摘要
我们探讨了一种新的外语学习情境,学习者在包含描述配对图像的句子的多模态语境中推断不熟悉单词的意义。我们使用不同的图像-文本对进行了针对人类参与者的研究。我们分析了数据特征(即图像和文本),这些特征使参与者更容易推断被遮盖或不熟悉单词的意义,以及参与者的语言背景与成功之间存在什么关联。我们发现只有一些直观的特征与参与者表现有强相关性,这促使我们进一步调查这些任务中成功的预测特征。我们还分析了人工智能系统推理参与者表现的能力,发现了改进这一推理能力的有前景的方向。
引用
@article{arxiv.2510.09815,
title = {Towards Understanding Ambiguity Resolution in Multimodal Inference of Meaning},
author = {Yufei Wang and Adriana Kovashka and Loretta Fernández and Marc N. Coutanche and Seth Wiener},
journal= {arXiv preprint arXiv:2510.09815},
year = {2025}
}
备注
Accepted to International Conference on Development and Learning (ICDL) 2025