中文

开发多模态特征提取的综合框架

计算机视觉与模式识别 2017-02-22 v1 信息检索 机器学习 多媒体

摘要

特征提取是许多应用数据科学工作流程的关键组件。近年来,人工智能和机器学习的快速发展导致特征提取工具和服务的激增,使数据科学家能够廉价且有效地沿着广泛的维度对数据进行标注——从检测图像中的人脸到分析连贯文本中表达的情感。遗憾的是,强大的特征提取服务的激增伴随着特征提取服务不同接口数量的相应扩张。在一个几乎每个新服务都有其自己的 API、文档和/或客户端库的世界里,需要组合来自多个来源的多样化特征的数据科学家往往被迫编写和维护日益复杂的特征提取流水线。为了应对这一挑战,我们引入了一个新的开源框架用于综合多模态特征提取。Pliers 是一个开源的 Python 包,支持对多样化数据类型(视频、图像、音频和文本)的标准化标注,并在设计时明确考虑了易用性和可扩展性。用户只需几行 Python 代码即可将广泛的现有特征提取工具应用于其数据,并且还可以通过编写模块化类轻松添加自己的自定义提取器。基于图的 API 支持快速开发复杂的特征提取流水线,并以单一标准化格式输出结果。我们描述了该包的架构,详述了其相对于先前特征提取工具箱的主要优势,并通过对大型功能性 MRI 数据集的示例应用,说明了 pliers 如何在提高代码清晰度和可维护性的同时,显著减少构建复杂特征提取工作流程所需的时间和精力。

关键词

引用

@article{arxiv.1702.06151,
  title  = {Developing a comprehensive framework for multimodal feature extraction},
  author = {Quinten McNamara and Alejandro de la Vega and Tal Yarkoni},
  journal= {arXiv preprint arXiv:1702.06151},
  year   = {2017}
}