中文

Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation

计算机视觉与模式识别 2024-12-04 v1 机器学习

摘要

气候变化正危及依赖健康海洋的社区和经济,威胁着全球广泛的生态多样性。将计算机视觉应用于海洋保育等特定领域的挑战在于,传统自上而下的学习方法在长尾分布、泛化和 domain transfer 方面受限。由于需要适应新环境并识别稀有或未见物种,规模化的物种识别尤其困难。为克服这些限制,我们提出利用底向、开放域学习框架作为面向图像和视频分析的韧性、可扩展解决方案。我们的初步演示使用预训练的视觉-语言模型 (VLM) 结合检索增强生成 (RAG) 作为 grounding,为后续的架构、训练和工程优化留出空间。我们通过在捕鱼船上对鱼类视频进行分类验证了这一方法,展示了在无域特定训练或任务知识的情况下,模型展现出惊人的检索和预测能力。

关键词

引用

@article{arxiv.2412.02262,
  title  = {Composing Open-domain Vision with RAG for Ocean Monitoring and Conservation},
  author = {Sepand Dyanatkar and Angran Li and Alexander Dungate},
  journal= {arXiv preprint arXiv:2412.02262},
  year   = {2024}
}

备注

Accepted to Climate Change AI Workshop at NeurIPS 2024. 9 pages, 6 figures, 1 table