电视节目多模态内容向量的余弦相似度
多媒体
2020-11-10 v1 计算与语言
信息检索
机器学习
摘要
多模态信息源自多种来源:视听文件、文本描述和元数据。我们展示了如何将各独立来源编码的内容用向量表示、如何通过中间与后期融合技术组合向量,以及如何计算内容间的语义相似度。我们的向量表示由音频的谱特征与音频词袋、字幕的 LSI 主题与 Doc2vec 嵌入,以及元数据的类别特征构建。我们在 BBC 电视节目数据集上实现模型,并评估融合表示以提供推荐。后期融合的相似度矩阵显著提升了推荐的精度与多样性。
引用
@article{arxiv.2009.11129,
title = {Cosine Similarity of Multimodal Content Vectors for TV Programmes},
author = {Saba Nazir and Taner Cagali and Chris Newell and Mehrnoosh Sadrzadeh},
journal= {arXiv preprint arXiv:2009.11129},
year = {2020}
}
备注
3 pages, 1 figure, Machine Learning for Media Discovery (ML4MD) Workshop at ICML 2020