平衡共享与任务特定表征:基于深度感知视频全景分割的混合方法
计算与语言
2024-12-12 v1
摘要
本文提出了Multiformer,这是一种基于掩码转换器范式的深度感知视频全景分割(DVPS)新方法。我们的模型学习跨分割、单目深度估计和目标跟踪子任务的共享对象表征。与最近的统一方法逐步细化公共对象表征不同,我们提出一种混合方法,在每个解码器块内部使用任务特定分支,最终在块接口处融合为共享表征。在Cityscapes-DVPS和SemKITTI-DVPS数据集上的大量实验表明,Multiformer在所有DVPS指标上均实现了最先进的性能,显著优于先前方法。使用ResNet-50主干网络时,Multiformer比前一最佳结果高出3.0个DVPQ分数,同时改善了深度估计精度。使用Swin-B主干网络时,Multiformer进一步提升了4.0个DVPQ分数的性能。Multiformer还为多任务解码器架构设计提供了宝贵的见解。
引用
@article{arxiv.2412.07965,
title = {HalluCana: Fixing LLM Hallucination with A Canary Lookahead},
author = {Tianyi Li and Erenay Dayanik and Shubhi Tyagi and Andrea Pierleoni},
journal= {arXiv preprint arXiv:2412.07965},
year = {2024}
}