学习组合主题感知混合专家模型以实现零样本视频描述
计算与语言
2018-11-27 v2 计算机视觉与模式识别
信息检索
摘要
尽管视频描述已取得令人鼓舞的成果,现有模型受限于训练语料中固定的活动词表,无法泛化至开放词表场景。本文引入一项新任务——零样本视频描述,旨在描述包含未见活动的域外视频。不同活动的视频通常在诸多方面需要不同的描述策略,即词选、语义构建与风格表达等,这给在无配对训练数据情况下刻画新活动带来巨大挑战。但与此同时,相似活动在这些方面存在部分共性。因此,我们提出一种原则性的主题感知混合专家(TAMoE)模型用于零样本视频描述,该模型学习基于不同主题嵌入组合不同专家,隐式地将从已见活动学到的知识迁移至未见活动。此外,我们利用外部主题相关文本语料为每个活动构建主题嵌入,其蕴含该主题内最相关的语义向量。实证结果不仅验证了我们的方法在利用语义知识进行视频描述方面的有效性,也展示了其在描述新活动时的强泛化能力。
引用
@article{arxiv.1811.02765,
title = {Learning to Compose Topic-Aware Mixture of Experts for Zero-Shot Video Captioning},
author = {Xin Wang and Jiawei Wu and Da Zhang and Yu Su and William Yang Wang},
journal= {arXiv preprint arXiv:1811.02765},
year = {2018}
}
备注
Accepted to AAAI 2019