OmniQuery:上下文增强捕获的多模态记忆以实现个人问答
人机交互
2025-02-24 v2 人工智能
摘要
人们经常通过照片、截图和视频记录记忆。虽然现有的基于 AI 的工具支持使用自然语言查询这些数据,但它们仅支持检索单条信息(如照片中的特定对象),难以回答涉及解释相互关联记忆(如连续事件)的更复杂查询。我们进行了一项为期一个月的日记研究,以收集真实的用户查询,并生成了用于与捕获记忆整合的必要上下文信息分类法。随后我们介绍了 OmniQuery,这是一个新颖的系统,能够回答需要提取和推断上下文信息的复杂个人记忆相关问题。OmniQuery 通过整合来自多个相互关联记忆的分散上下文信息来增强单个捕获的记忆。给定一个问题,OmniQuery 检索相关的增强记忆,并使用大语言模型(LLM)生成带有参考的答案。在人类评估中,我们展示了 OmniQuery 的有效性,其准确率达到 71.5%,在 74.5% 的情况下胜出或战平传统 RAG 系统。
引用
@article{arxiv.2409.08250,
title = {OmniQuery: Contextually Augmenting Captured Multimodal Memory to Enable Personal Question Answering},
author = {Jiahao Nick Li and Zhuohao Jerry Zhang and Jiaju Ma},
journal= {arXiv preprint arXiv:2409.08250},
year = {2025}
}
备注
Paper accepted to the 2025 CHI Conference on Human Factors in Computing Systems (CHI 2025)