YOLOA:通过 LLM 适配器实现实时可Affordance检测
计算机视觉与模式识别
2025-12-04 v1 人机交互
摘要
可Affordance检测旨在联合解决具身 AI 中的"what-where-how"基础性问题,通过理解对象是什么、位于何处以及如何被使用。然而,大多数可Affordance学习方法仅关注对象如何被使用,忽略了"what"和"where"方面;另有方法则将对象检测与可Affordance学习视为独立任务,缺乏有效交互与实时性。为此,我们引入 YOLO Affordance(YOLOA),一种通过大语言模型(LLM)适配器联合处理这两项任务的实时可Affordance检测模型。具体而言,YOLOA 采用由 LLM Adapter 细化的对象检测与可Affordance学习分支构成的轻量级探测器。训练期间,LLM Adapter 通过生成更准确的类别先验、框偏移量和可Affordance门控,与对象与可Affordance的初步预测进行交互,从而细化两个分支。在我们重新标注的 ADG-Det 和 IIT-Heat 数据集上进行实验,显示 YOLOA 在 ADG-Det / IIT-Heat 上分别达到 52.8 / 73.1 的最新水平 mAP,同时保持实时性能(最高可达 89.77 FPS,轻量级变体最高可达 846.24 FPS),表明 YOLOA 在精度与效率之间实现了卓越的平衡。
关键词
引用
@article{arxiv.2512.03418,
title = {YOLOA: Real-Time Affordance Detection via LLM Adapter},
author = {Yuqi Ji and Junjie Ke and Lihuo He and Jun Liu and Kaifan Zhang and Yu-Kun Lai and Guiguang Ding and Xinbo Gao},
journal= {arXiv preprint arXiv:2512.03418},
year = {2025}
}
备注
13 pages, 9 figures, conference