AVR:同步化面向音视频搞笑检测的基础模型
音频与语音处理
2024-06-18 v1 声音
摘要
本文提出了 AVR 用于音视频搞笑检测的应用。虽然搞笑检测传统上集中在文本分析上,但最近的进展聚焦于多模态方法。然而,这些方法依赖文本线索作为一种模态, necessitating 使用 ASR 系统对音频数据进行转录。这一对 ASR 准确率的重大依赖在实际应用中可能构成挑战。为解决这一瓶颈,我们提出了一种创新的音视频搞笑检测系统,规避了对文本的依赖,消除了对 ASR 模型的需求。相反,该方法依赖于音频和视觉内容之间的精妙互动,以实现有效的搞笑检测。
引用
@article{arxiv.2406.10448,
title = {AVR: Synergizing Foundation Models for Audio-Visual Humor Detection},
author = {Sarthak Sharma and Orchid Chetia Phukan and Drishti Singh and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2406.10448},
year = {2024}
}
备注
Accepted to INTERSPEECH 2024 Show & Tell Demonstrations