面向人类活动识别的动态类间混淆感知编码器
计算机视觉与模式识别
2025-07-15 v1
摘要
人类不会孤立地理解单个事件,而是将概念在类别内推广,并与其他类别进行比较。现有的音视频预训练范例仅关注整体音视频模态的对齐,而未考虑在训练期间通过认知归纳和对比来强化区分易混淆类别的能力。本文提出了动态类间混淆感知编码器(Dynamic Inter-Class Confusion-Aware Encoder, DICCAE),一种在类别水平上对音视频表示进行细粒度对齐的编码器。DICCAE通过动态调整基于类别间混淆程度的混淆损失来解决类别混淆问题,从而增强模型区分相似活动的能力。为进一步扩展DICCAE的应用,我们还引入了一种新型训练框架,融合了音频和视频模态以及它们的融合。为缓解人类活动识别任务中音视频数据稀缺的问题,我们提出了一种基于DICCAE的集群引导音视频自监督预训练策略。DICCAE在VGGSound数据集上实现了接近最新的性能,顶级准确率为65.5%。我们进一步通过大量消融研究评估了其特征表示质量,验证了每个模块的必要性。
引用
@article{arxiv.2507.09323,
title = {Dynamic Inter-Class Confusion-Aware Encoder for Audio-Visual Fusion in Human Activity Recognition},
author = {Kaixuan Cong and Yifan Wang and Rongkun Xue and Yuyang Jiang and Yiming Feng and Jing Yang},
journal= {arXiv preprint arXiv:2507.09323},
year = {2025}
}