基于DropTriple损失的动作与文本跨模态检索
计算机视觉与模式识别
2026-02-10 v4 计算与语言
摘要
图像-文本与视频-文本的跨模态检索是计算机视觉与自然语言处理中的热门研究方向。然而,尽管人体动作与文本之间的跨模态检索具有广泛的应用前景,却未受到足够关注。为弥补这一不足,我们采用一种简洁而有效的双单模态Transformer编码器来处理该任务。考虑到不同人体动作序列中重叠的原子动作会导致样本间的语义冲突,我们探索了一种称为DropTriple Loss的新型三元组损失函数。该损失函数从负样本集中丢弃假负样本,并聚焦于挖掘其余真正困难的负样本进行三元组训练,从而减少它们造成的违例。我们在HumanML3D与KIT Motion-Language数据集上评估了我们的模型与方法。在最新的HumanML3D数据集上,我们实现了动作检索62.9%与文本检索71.5%的召回率(均基于R@10)。我们的方法源代码已公开于https://github.com/eanson023/rehamot。
引用
@article{arxiv.2305.04195,
title = {Cross-Modal Retrieval for Motion and Text via DropTriple Loss},
author = {Sheng Yan and Yang Liu and Haoqiang Wang and Xin Du and Mengyuan Liu and Hong Liu},
journal= {arXiv preprint arXiv:2305.04195},
year = {2026}
}
备注
This paper has been accepted by ACM MM Asia 2023 (Best Paper Candidate)