中文

电视节目多模态内容向量的余弦相似度

多媒体 2020-11-10 v1 计算与语言 信息检索 机器学习

摘要

多模态信息源自多种来源:视听文件、文本描述和元数据。我们展示了如何将各独立来源编码的内容用向量表示、如何通过中间与后期融合技术组合向量,以及如何计算内容间的语义相似度。我们的向量表示由音频的谱特征与音频词袋、字幕的 LSI 主题与 Doc2vec 嵌入,以及元数据的类别特征构建。我们在 BBC 电视节目数据集上实现模型,并评估融合表示以提供推荐。后期融合的相似度矩阵显著提升了推荐的精度与多样性。

关键词

引用

@article{arxiv.2009.11129,
  title  = {Cosine Similarity of Multimodal Content Vectors for TV Programmes},
  author = {Saba Nazir and Taner Cagali and Chris Newell and Mehrnoosh Sadrzadeh},
  journal= {arXiv preprint arXiv:2009.11129},
  year   = {2020}
}

备注

3 pages, 1 figure, Machine Learning for Media Discovery (ML4MD) Workshop at ICML 2020