无盲点区域对词类指代映射的影响?基于婴儿体顶视视频的计算研究
计算机视觉与模式识别
2025-11-18 v1 人工智能
摘要
通常情况下,儿童会在6至9个月大时开始学习第一个词语,将语言与其视觉指称物关联。缺乏先验知识时,首次遇到的某个词可能以无数方式被解释:它可能指代环境中的任意物体、其组成部分或属性。本文基于一名婴儿长期体顶视、生态学有效的数据,提出一种自监督且符合生物学可信度的策略,以学习强大的视觉表征。我们的掩码自编码器视觉主干网络融合了对人类眼睛盲区知识的认识,定义了一种新颖的掩码策略。这种掩码与重构方法旨在模拟人脑填补眼睛视野空白的方式。这标志着从传统随机掩码策略转变,后者在生物学角度难以合理解释。该预训练编码器被用于对比学习基础的视频-文本模型,能够获取词语与视觉指称物的映射。广泛的评估表明,所提出的符合生物学可信度的掩码策略至少在从跨情境和持续时间扩展的情节中学习词语指称映射方面,与随机掩码一样有效。
引用
@article{arxiv.2511.11725,
title = {Do Blind Spots Matter for Word-Referent Mapping? A Computational Study with Infant Egocentric Video},
author = {Zekai Shi and Zhixi Cai and Kalin Stefanov},
journal= {arXiv preprint arXiv:2511.11725},
year = {2025}
}