中文

模型在环(MILO):利用 LLM 加速多模态 AI 数据标注

人机交互 2024-09-25 v2 人工智能 计算与语言 机器学习

摘要

对 AI 训练数据不断增长的需求已将数据标注转变为一个全球性产业,但依赖人类标注员的传统方法通常耗时、劳动密集且容易出现质量不一致的问题。我们提出了模型在环(MILO)框架,该框架将 AI/ML 模型集成到标注过程中。我们的研究引入了一种协作范式,利用专业人类标注员和大型语言模型(LLM)的优势。通过将 LLM 用作预标注和实时助手,以及标注员响应的评判者,MILO 实现了人类标注员与 LLM 之间的有效交互模式。针对多模态数据标注的三项实证研究证明了 MILO 在减少处理时间、提高数据质量和改善标注员体验方面的有效性。我们还引入了质量准则,用于对开放式标注进行灵活评估和细粒度反馈。MILO 框架对于加速 AI/ML 开发、减少对纯人工标注的依赖以及促进人类与机器价值观之间更好的对齐具有重要意义。

关键词

引用

@article{arxiv.2409.10702,
  title  = {Model-in-the-Loop (MILO): Accelerating Multimodal AI Data Annotation with LLMs},
  author = {Yifan Wang and David Stevens and Pranay Shah and Wenwen Jiang and Miao Liu and Xu Chen and Robert Kuo and Na Li and Boying Gong and Daniel Lee and Jiabo Hu and Ning Zhang and Bob Kamma},
  journal= {arXiv preprint arXiv:2409.10702},
  year   = {2024}
}