MMTM:基于相似门控融合的长视频三模态主题模型
机器学习
2026-05-29 v1
摘要
我们提出 MMTM(Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion),这是一套用于长视频主题发现的模块化管道,集成了语音识别、音频和视觉嵌入,以及通过确定性相似门控融合的 BERTopic 聚类。该方法在德语(Tagesschau)和英语(NBC)播客新闻上的跨语言评估表明,联合三模态建模显著提升了主题质量:噪声降低从 0.27 降至 0.06,转换率从 0.70 降至 0.21,归一化熵从 0.84 提升至 0.92,表明主题更具一致性和更稳定的时序特性。聚类有效性(Calinski-Harabasz 指数)在各嵌入空间中提升了 5-12 倍。词汇一致性(NPMI)在德语文本上从 0.77 提升至 0.86,但因语料特性不同,未在较短的 NBC 播客中 transferring。我们发布了该管道代码及一套经双标注师视觉评估和 LLM 辅助标注的人类验证的 54 小时多模态视频主题语料库。
引用
@article{arxiv.2605.29765,
title = {MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion},
author = {Ali Abusaleh and Bhuvanesh Verma and Alexander Mehler},
journal= {arXiv preprint arXiv:2605.29765},
year = {2026}
}
备注
Submitted to EMNLP 2026