中文

平衡共享与任务特定表征:基于深度感知视频全景分割的混合方法

计算与语言 2024-12-12 v1

摘要

本文提出了Multiformer,这是一种基于掩码转换器范式的深度感知视频全景分割(DVPS)新方法。我们的模型学习跨分割、单目深度估计和目标跟踪子任务的共享对象表征。与最近的统一方法逐步细化公共对象表征不同,我们提出一种混合方法,在每个解码器块内部使用任务特定分支,最终在块接口处融合为共享表征。在Cityscapes-DVPS和SemKITTI-DVPS数据集上的大量实验表明,Multiformer在所有DVPS指标上均实现了最先进的性能,显著优于先前方法。使用ResNet-50主干网络时,Multiformer比前一最佳结果高出3.0个DVPQ分数,同时改善了深度估计精度。使用Swin-B主干网络时,Multiformer进一步提升了4.0个DVPQ分数的性能。Multiformer还为多任务解码器架构设计提供了宝贵的见解。

关键词

引用

@article{arxiv.2412.07965,
  title  = {HalluCana: Fixing LLM Hallucination with A Canary Lookahead},
  author = {Tianyi Li and Erenay Dayanik and Shubhi Tyagi and Andrea Pierleoni},
  journal= {arXiv preprint arXiv:2412.07965},
  year   = {2024}
}