中文

SLVideo:面向手语视频的时刻检索框架

计算机视觉与模式识别 2024-11-07 v2 人工智能

摘要

SLVideo 是一个针对手语视频的视频时刻检索系统, Incorporation of facial expressions (面部表情) 旨在解决现有技术中的这一空白。该系统从视频帧中提取手部和面部手势的嵌入表示,以完整地捕捉手语,从而使用户能够以文本查询搜索特定的手语视频片段。使用一套标注好的约 8 小时葡萄牙语手语视频作为数据集,并使用 CLIP 模型生成嵌入。初始结果在 zero-shot setting 下显示前景广阔。此外,SLVideo 集成了一个 thesaurus (词典/同义词库),使用户能够使用检索到的视频片段嵌入寻找相似的手语,也支持编辑和创建视频手语注释。项目网页:https://novasearch.github.io/SLVideo/

关键词

引用

@article{arxiv.2407.15668,
  title  = {SLVideo: A Sign Language Video Moment Retrieval Framework},
  author = {Gonçalo Vinagre Martins and João Magalhães and Afonso Quinaz and Carla Viegas and Sofia Cavaco},
  journal= {arXiv preprint arXiv:2407.15668},
  year   = {2024}
}

备注

4 pages, 1 figure, 1 table