中文

Gensors:使用多模态基础模型和推理 authoring 个性化视觉传感器

人机交互 2025-01-28 v1 人工智能

摘要

多模态大语言模型(MLLMs)凭借其广泛的世界知识和推理能力,为 end-users 创建能够对复杂情境进行推理的个人化 AI 传感器提供了独特的机会。用户可以用自然语言描述所需的感知任务(例如"如果我的幼儿进入麻烦中则发出警报"),MLLM会分析摄像头 feed 并在几秒钟内作出响应。在一次形式化研究中,我们发现用户在通过提示 alone 定义自己的传感器时看起来非常宝贵,但却在 articulating 自己的独特个人要求和通过提示调试传感器方面受到了限制。为此,我们开发了Gensors,一个赋予用户定义受 MLLM 推理能力支持的定制传感器的系统。Gensors 1)通过自动生成和手动创建的传感器准则帮助用户提取要求,2)通过允许用户并行隔离和测试单个准则来促进调试,3)基于用户提供的图像建议额外的准则,4)提出测试用例以帮助用户在潜在的不可预见情境中对传感器进行"压力测试"。在一次用户研究中,参与者报告称,使用Gensors定义传感器后,他们对控制感、理解和沟通难度显著提升。除了解决模型局限性之外,Gensors还支持用户进行调试、提取要求和通过准则推理表达独特的个人要求;它还通过暴露被忽视的准则和揭示意外失效模式来帮助发现用户的"盲点"。最后,我们讨论了独特的MLLM特征(如幻觉和不一致的响应)如何影响传感器创建过程。这些发现为设计直观且可定制的面向普通用户的智能感知系统做出了贡献。

关键词

引用

@article{arxiv.2501.15727,
  title  = {Gensors: Authoring Personalized Visual Sensors with Multimodal Foundation Models and Reasoning},
  author = {Michael Xieyang Liu and Savvas Petridis and Vivian Tsai and Alexander J. Fiannaca and Alex Olwal and Michael Terry and Carrie J. Cai},
  journal= {arXiv preprint arXiv:2501.15727},
  year   = {2025}
}