通过解耦权重融合实现动态环境中稳健的具身感知
计算机视觉与模式识别
2026-04-03 v1 人工智能
摘要
具身感知系统在持续与开放物理空间中的交互过程中面临严重的动态环境分布漂移挑战。然而,现有的域增量感知方法通常依赖于测试阶段预先获得的域 ID,这限制了其在未知交互情景中的实用性。同时,模型常常过度拟合于特定情境下的感知噪声,从而导致泛化能力不足和灾难性遗忘。为此,我们提出了一个无需域 ID 和样本的具身多媒体系统的增量学习框架,旨在实现稳健的持续环境适应。该方法设计了解耦表示机制,以消除非本质性环境风格干扰,引导模型聚焦于跨场景共享的语义内在特征,从而消除感知不确定性并提高泛化性。我们进一步采用权重融合策略,在参数空间中动态整合旧环境和新环境知识,以确保模型适应新分布且最大程度保留旧环境的判别能力,而无需存储历史数据。多个实验在多个标准基准数据集上表明,所提方法在完全无样本和无域 ID 的设置下显著减少了灾难性遗忘,其准确率优于现有最先进方法。
引用
@article{arxiv.2604.01669,
title = {Robust Embodied Perception in Dynamic Environments via Disentangled Weight Fusion},
author = {Juncen Guo and Xiaoguang Zhu and Jingyi Wu and Jingyu Zhang and Jingnan Cai and Zhenghao Niu and Liang Song},
journal= {arXiv preprint arXiv:2604.01669},
year = {2026}
}
备注
Accepted by ICME2026