听见我,看见我,理解我:基于音视频的自闭行为识别
音频与语音处理
2024-06-06 v1 人工智能
计算与语言
计算机视觉与模式识别
机器学习
多媒体
摘要
本文介绍一种新颖的自闭行为识别问题,包括社交行为识别,这一方面此前在AI辅助自闭筛查研究中被忽略。我们将任务定义为音视频自闭行为识别,该方法利用音频和视觉线索,包括音频中的任何语音,以识别与自闭相关的行为。为推动该新研究方向,我们收集了一个音视频自闭谱系数据集(AV-ASD),目前是规模最大的用于行为方法自闭筛查的视频数据集。它涵盖了广泛的自闭相关行为,包括与社交沟通和互动相关的行为。为进一步研究该问题,我们深入探索了利用基础模型和多模态大语言模型在不同模态上的应用。我们在AV-ASD数据集上的实验表明,整合音频、视觉和语音模态显著提高了自闭行为识别性能。此外,我们还探索了使用后验式到自适应管道在多模态大语言模型中,以调查其在自闭行为识别中增强模型解释能力的潜力。我们将公开数据集、代码和预训练模型。
引用
@article{arxiv.2406.02554,
title = {Hear Me, See Me, Understand Me: Audio-Visual Autism Behavior Recognition},
author = {Shijian Deng and Erin E. Kosloski and Siddhi Patel and Zeke A. Barnett and Yiyang Nan and Alexander Kaplan and Sisira Aarukapalli and William T. Doan and Matthew Wang and Harsh Singh and Pamela R. Rollins and Yapeng Tian},
journal= {arXiv preprint arXiv:2406.02554},
year = {2024}
}