中文

MAGNeT:面向复杂情景中移动目标选择的多模态自适应高斯网络

多媒体 2025-08-20 v2

摘要

多媒体交互系统中的移动目标选择正面临前所未有的挑战,因为用户正越来越多地在来自不同且动态背景的交互——从移动车辆中的直播流到不断变化的环境中的VR游戏。现有方法依赖于关联端点分布与目标属性(如大小和速度)的概率模型。然而,这些方法需要为每个新情境收集大量训练数据,且在不同情境之间缺乏可迁移性,限制了其在丰富多模态上下文信息 readily available 的多样化多媒体环境中的实际部署。本文引入MAGNeT(Multimodal Adaptive Gaussian Networks),通过将经典统计建模与上下文感知的多模态方法相结合来解决上述问题。MAGNeT 动态融合来自各种情境中预先拟合的三元高斯模型,基于实时上下文线索,实现了最小训练数据即可有效适应,同时保持模型可解释性。我们在自构建的2D和3D移动目标选择数据集上进行实验,模拟了车辆振动条件。广泛实验表明,MAGNeT 通过应用基于上下文的高斯专家在多因素条件下的自适应融合,能够在极少样本情况下获得更低的错误率。

关键词

引用

@article{arxiv.2508.12992,
  title  = {MAGNeT: Multimodal Adaptive Gaussian Networks for Intent Inference in Moving Target Selection across Complex Scenarios},
  author = {Xiangxian Li and Yawen Zheng and Baiqiao Zhang and Yijia Ma and Xianhui Cao and Juan Liu and Yulong Bian and Jin Huang and Chenglei Yang},
  journal= {arXiv preprint arXiv:2508.12992},
  year   = {2025}
}

备注

Accepted by ACM MM 2025