中文

编码-存储-检索:通过语言编码的第一视角感知增强人类记忆

计算机视觉与模式识别 2024-10-21 v3 人工智能 人机交互

摘要

我们依赖自身记忆来编码、存储和检索经验。然而,记忆失误可能发生。实现记忆增强的一个有前景的途径是使用增强现实头戴式显示器来捕获和保存第一视角视频,这种做法通常称为生活记录(lifelogging)。然而,生活记录生成的视频数据体量巨大,当前技术缺乏高效编码和存储如此大量数据的能力,这带来了重大挑战。此外,从海量视频档案中检索特定信息需要大量计算能力,进一步使快速访问所需内容的任务复杂化。为应对这些挑战,我们提出一种记忆增强智能体,其利用自然语言编码视频数据并将其存储在向量数据库中。该方法借助大型视觉语言模型执行语言编码过程。此外,我们提出使用大型语言模型来促进自然语言查询。我们的智能体使用 QA-Ego4D 数据集进行了广泛评估,取得了 SOTA 结果,BLEU 得分为 8.3,优于得分在 3.4 至 5.8 之间的常规机器学习模型。另外,我们开展了一项用户研究,参与者通过情景记忆和开放式问题与该人类记忆增强智能体交互。研究结果表明,在情景记忆任务上,该智能体的回忆表现显著优于人类参与者。结果还凸显了该智能体的实际适用性和用户接受度。

关键词

引用

@article{arxiv.2308.05822,
  title  = {Encode-Store-Retrieve: Augmenting Human Memory through Language-Encoded Egocentric Perception},
  author = {Junxiao Shen and John Dudley and Per Ola Kristensson},
  journal= {arXiv preprint arXiv:2308.05822},
  year   = {2024}
}