中文

语义句子相似度:规模并非总是关键

计算与语言 2022-03-31 v1

摘要

本研究探讨视觉接地语音识别(VGS)模型是否能在无任何先验语言知识的情况下学习捕捉句子语义。我们生成了知名语义文本相似度数据库的合成与自然语音版本,并表明我们的 VGS 模型产生的嵌入与人类语义相似度判断具有良好相关性。我们的结果显示,在小规模图像-描述数据库上训练的模型优于在两个大规模数据库上训练的模型,表明数据库规模并非唯一要害。我们还研究了每幅图像拥有多个描述的重要性,发现即便图像总数较少,这也确实有帮助,暗示释义是一种有价值的学习信号。尽管该领域总体趋势是创建更大数据集以训练模型,我们的发现表明数据库的其他特征可能同样重要。

关键词

引用

@article{arxiv.2106.08648,
  title  = {Semantic sentence similarity: size does not always matter},
  author = {Danny Merkx and Stefan L. Frank and Mirjam Ernestus},
  journal= {arXiv preprint arXiv:2106.08648},
  year   = {2022}
}

备注

This paper has been accepted at Interspeech 2021 where it will be presented and appear in the conference proceedings in September 2021