Falcon Perception
计算机视觉与模式识别
2026-03-31 v1
摘要
感知中心系统通常以模块化的编码器-解码器管线实现: 用于特征提取的视觉 backbone 和用于任务预测的独立解码器 (或 late-fusion 模块). 这引出一个核心问题: 这种架构分离是否至关重要, 或者单个 early-fusion 堆栈能否在规模上同时完成感知和任务建模? 我们引入 Falcon Perception, 一个统一的稠密 Transformer, 其从第一层开始处理图像块和文本标记于共享参数空间, 使用混合注意力模式 (在图像标记之间双向, 在预测标记上因果) 将全局视觉上下文与自回归、可变长实例生成相结合. 为保持稠密输出的实用性, Falcon Perception 保留轻量级 token 接口, 并通过专用 head 对连续空间输出进行解码, 实现平行高分辨率掩码预测. 我们的设计促进简单性: 我们保持单个可扩展 backbone, 将复杂性转移到数据和训练信号中, 在输出为连续稠密时仅添加小型 head. 在 SA-Co 上, Falcon Perception 将掩码质量提高到 68.0 Macro-F, 相较于 SAM3 的 62.3. 我们还引入 PBench, 一个针对构成性提示 (OCR、空间约束、关系) 和稠密长上下文场景的基准, 在该基准上该模型显示出更好的提升. 此外, 我们将相同的 early-fusion 配方扩展到 Falcon OCR: 一个紧凑的 300M 参数模型, 在 olmOCR 上达到 80.3%, 在 OmniDocBench 上达到 88.64.
引用
@article{arxiv.2603.27365,
title = {Falcon Perception},
author = {Aviraj Bevli and Sofian Chaybouti and Yasser Dahou and Hakim Hacid and Ngoc Dung Huynh and Phuc H. Le Khac and Sanath Narayan and Wamiq Reyaz Para and Ankit Singh},
journal= {arXiv preprint arXiv:2603.27365},
year = {2026}
}