ET tu, CLIP? 解决未见环境中的常见物体错误
计算机视觉与模式识别
2024-06-27 v1 人工智能
计算与语言
机器学习
机器人学
摘要
我们提出了一种简单方法,利用预训练的CLIP编码器来增强ALFRED任务中的模型泛化能力。与以往文献中CLIP替换视觉编码器的做法不同,我们建议通过辅助目标检测目标将CLIP作为附加模块使用。我们在最近提出的Episodic Transformer架构上验证了我们的方法,并证明引入CLIP能提升在未见验证集上的任务性能。此外,我们的分析结果支持CLIP特别有助于利用物体描述、检测小物体和解释罕见词汇。
引用
@article{arxiv.2406.17876,
title = {ET tu, CLIP? Addressing Common Object Errors for Unseen Environments},
author = {Ye Won Byun and Cathy Jiao and Shahriar Noroozizadeh and Jimin Sun and Rosa Vitiello},
journal= {arXiv preprint arXiv:2406.17876},
year = {2024}
}