中文

评估大型语言模型作为时间序列物理传感数据的虚拟标注器

机器学习 2024-09-24 v2 信号处理

摘要

传统的基于人在回路的时间序列数据(如惯性数据)标注通常需要从环境中获取视频或音频等替代模态。这些替代源为人类标注者提供了必要的信息,因为原始数值数据即使对专家而言也往往过于晦涩。然而,这种传统方法在总体成本、效率、额外模态的存储、时间、可扩展性和隐私方面存在诸多问题。有趣的是,近期的大型语言模型(LLMs)也使用大量公开可用的字母数字数据进行训练,这使得它们能够理解并在自然语言处理之外的任务上表现良好。自然而然地,这开辟了一条探索LLMs作为虚拟标注器的潜在途径,其中LLMs将被直接提供原始传感数据进行标注,而不是依赖任何替代模态。这自然可以缓解传统人在回路方法的问题。受此观察启发,我们在本文中进行了一项详细的研究,以评估最先进(SOTA)的LLMs是否可以用作标记时间序列物理传感数据的虚拟标注器。为了以有原则的方式执行此操作,我们将研究分为两个主要阶段。在第一阶段,我们研究像GPT-4这样的LLM在理解原始传感数据时面临的挑战。考虑到第一阶段的观察,在下一阶段,我们研究使用SOTA自监督学习(SSL)方法编码原始传感数据并利用投影后的时间序列数据从LLM获取标注的可能性。在四个基准HAR数据集上的详细评估表明,基于SSL的编码和基于度量的引导使LLM能够做出更合理的决策,并在不需要计算昂贵的微调或复杂的提示工程的情况下提供准确的标注。

关键词

引用

@article{arxiv.2403.01133,
  title  = {Evaluating Large Language Models as Virtual Annotators for Time-series Physical Sensing Data},
  author = {Aritra Hota and Soumyajit Chatterjee and Sandip Chakraborty},
  journal= {arXiv preprint arXiv:2403.01133},
  year   = {2024}
}