探索图像描述中的可供性与情境化意义:一项多模态分析
计算与语言
2023-10-25 v2 计算机视觉与模式识别
摘要
本文从计算认知语言学视角探讨多模态语义表征的接地问题。我们用五种感知属性对Flickr30k数据集中的图像进行标注:可供性、感知显著性、物体数量、注视提示和生态位关联(ENA),并考察它们与图像描述中文本元素的关联。我们的发现揭示,与展现目的性可供性的图像相比,具有Gibsonian可供性的图像更频繁地出现含'持有类动词'和'容器类名词'的描述。感知显著性、物体数量和ENA也与语言表达式的选择相关联。我们的研究表明,对物体或事件的全面理解需要认知注意、语言中的语义细微差别以及跨多模态的整合。我们强调了情境化意义和可供性接地在自然语言理解中的至关重要性,其有望推进多种场景下类人的解释能力。
引用
@article{arxiv.2305.14616,
title = {Exploring Affordance and Situated Meaning in Image Captions: A Multimodal Analysis},
author = {Pin-Er Chen and Po-Ya Angela Wang and Hsin-Yu Chou and Yu-Hsiang Tseng and Shu-Kai Hsieh},
journal= {arXiv preprint arXiv:2305.14616},
year = {2023}
}
备注
10 pages, 9 figures