中文

OmniActions:利用 LLM 预测响应真实世界多模态感官输入的数字动作

人机交互 2024-05-08 v1 人工智能

摘要

向“普适增强现实”的演进设想了持续便捷地访问多模态信息。然而,在许多日常场景中,用户在身体、认知或社交上处于忙碌状态。这可能会增加用户对所遇到的多模态信息采取行动的阻力。为了减少这种阻力,未来的交互界面应根据用户的上下文智能地提供对数字动作的快速访问。为了探索可能的数字动作范围,我们进行了一项日记研究,要求参与者捕获并分享他们打算对其执行动作的媒体(例如图像或音频),以及他们期望的动作和其他上下文信息。利用这些数据,我们生成了一个整体的数字后续动作设计空间,这些动作可以响应不同类型的多模态感官输入而执行。然后,我们设计了 OmniActions,这是一个由大型语言模型(LLM)驱动的流水线,它处理多模态感官输入,并基于推导出的设计空间预测针对目标信息的后续动作。使用在日记研究中收集的实证数据,我们对三种 LLM 技术变体(意图分类、上下文学习和微调)进行了定量评估,并确定了最适合我们任务的技术。此外,作为该流水线的实例化,我们开发了一个交互式原型,并报告了关于人们如何感知和应对动作预测及其错误的初步用户反馈。

关键词

引用

@article{arxiv.2405.03901,
  title  = {OmniActions: Predicting Digital Actions in Response to Real-World Multimodal Sensory Inputs with LLMs},
  author = {Jiahao Nick Li and Yan Xu and Tovi Grossman and Stephanie Santosa and Michelle Li},
  journal= {arXiv preprint arXiv:2405.03901},
  year   = {2024}
}

备注

Paper accepted to the 2024 CHI Conference on Human Factors in Computing Systems (CHI 2024)