中文

SNIFR:通过级联交叉变换器实现音视频对齐以增强细粒度儿童有害内容检测

音频与语音处理 2025-06-05 v1 计算机视觉与模式识别 多媒体

摘要

随着过去十年视频分享平台的增长,儿童观看量激增,对精确检测暴力或露骨场景等有害内容的需求日益增加。恶意用户通过在极少帧中嵌入不安全内容来规避检测系统。虽然先前研究聚焦于视觉线索并推动了此类细粒度检测的发展,但音频特征仍未得到充分探索。在本研究中,我们将音频线索与视觉线索结合,用于细粒度儿童有害内容检测,并提出了 SNIFR——一个用于有效对齐的新型框架。SNIFR 采用变换器编码器进行模态内交互,随后采用级联交叉变换器进行模态间对齐。我们的方法在单模态和基线融合方法上取得了优越性能,设立了新的最先进水平。

关键词

引用

@article{arxiv.2506.03378,
  title  = {SNIFR : Boosting Fine-Grained Child Harmful Content Detection Through Audio-Visual Alignment with Cascaded Cross-Transformer},
  author = {Orchid Chetia Phukan and Mohd Mujtaba Akhtar and Girish and Swarup Ranjan Behera and Abu Osama Siddiqui and Sarthak Jain and Priyabrata Mallick and Jaya Sai Kiran Patibandla and Pailla Balakrishna Reddy and Arun Balaji Buduru and Rajesh Sharma},
  journal= {arXiv preprint arXiv:2506.03378},
  year   = {2025}
}

备注

Accepted to INTERSPEECH 2025