口语的视觉接地模型:数据集、架构与评估技术综述
人工智能
2022-02-22 v3 计算与语言
机器学习
声音
音频与语音处理
摘要
本综述概述了过去20年间口语视觉接地模型的发展演进。此类模型受到以下观察的启发:儿童在习得语言时,依赖于广泛间接且含噪的线索,其中关键包括与口语话语共现的视觉模态信号。多个领域为这种建模或模仿语言学习过程的方法作出了重要贡献:机器学习、自然语言与语音处理、计算机视觉以及认知科学。本文汇集了这些贡献,以便为所有这些领域的从业者提供有益的介绍与概览。我们讨论了所解决的核心研究问题、发展时间线,以及支撑了诸多此项工作的数据集。随后我们总结了主要建模架构,并对评估指标与分析技术给出了详尽的概览。
引用
@article{arxiv.2104.13225,
title = {Visually grounded models of spoken language: A survey of datasets, architectures and evaluation techniques},
author = {Grzegorz Chrupała},
journal= {arXiv preprint arXiv:2104.13225},
year = {2022}
}