中文

面向图片描述的自动时空语义分析:语言模型的进阶方法

计算与语言 2025-10-08 v1 计算机视觉与模式识别 音频与语音处理

摘要

当前用于自动评估认知语言障碍的方法通常忽视了视觉叙事路径——说话者在图片中描述元素的序列和位置。时空语义特征分析捕捉这一路径,使用内容信息单元(CIUs),但手动标注或基于词典的映射工作量大。本研究提出了基于 BERT 的管道,通过二元交叉熵和两两排序损失进行微调,用于从 Cookie Theft 图片描述中自动提取和排序 CIUs。通过 5 折交叉验证评估,实现了 93% 的中位精确率、96% 的中位召回率,以及 24% 的序列错误率。该方法提取的特征与真实值之间的皮尔逊相关系数很强,超越基于词典的基线方法在外部验证中表现更佳。这些特征在通过 ANCOVA 评估组间差异时,也与手动标注得到的特征性能相当。该管道有效地刻画了视觉叙事路径,适用于认知障碍评估,实现和模型均已开源于公众。

关键词

引用

@article{arxiv.2510.05128,
  title  = {Advancing Automated Spatio-Semantic Analysis in Picture Description Using Language Models},
  author = {Si-Ioi Ng and Pranav S. Ambadi and Kimberly D. Mueller and Julie Liss and Visar Berisha},
  journal= {arXiv preprint arXiv:2510.05128},
  year   = {2025}
}