中文

Meow-Omni 1:用于猫科动物学的多模态大语言模型

计算与语言 2026-05-12 v1 神经元与认知

摘要

解码动物意图是计算生态学中的根本挑战,主要是由于语义别名现象——相同外部信号(如猫的呼噜声)根据生理情境对应截然不同的内部状态。现有的多模态大语言模型(MLLM)对高频生物时间序列数据一无所知,限制其仅能进行浅层行为模式匹配,而无法进行真正的潜在状态推理。为弥合这一差距,我们介绍Meow-Omni 1,这是首个为计算生态学专门构建的开源四模态MLLM。它原生融合视频、音频和生理时间序列流与文本推理。通过针对性的架构调整,我们将专用科学编码器集成到统一主干网络中,并通过生理学依据的跨模态对齐形式化意图推理。在MeowBench——一个新颖且经专家验证的四模态基准——上,Meow-Omni 1实现了最先进的意图识别准确率(71.16%),显著优于领先的视觉语言和全模态基线。我们发布完整的开源管道,包括模型权重、训练框架和Meow-10K数据集,以建立可扩展的跨种种意图理解范式,推动基础模型向真实世界的兽医诊断和野生动物保育迈进。

关键词

引用

@article{arxiv.2605.09152,
  title  = {Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology},
  author = {Jucheng Hu and Zhangquan Chen and Yulin Chen and Chengjie Hong and Liang Zhou and Tairan Wang and Sifei Li and Giulio Zhu and Feng Zhou and Yiheng Zeng and Suorong Yang and Dongzhan Zhou},
  journal= {arXiv preprint arXiv:2605.09152},
  year   = {2026}
}