中文

Sherlock in OSS:对象存储系统中基于内容检索的新方法

分布式、并行与集群计算 2023-05-09 v2

摘要

云中的对象存储系统(OSS)具备可扩展性、持久性、可用性与并发性。然而,开源 OSS 缺乏特定方法,使用户与管理员能够基于对象存储内部所含数据本身进行搜索,而无需牵动整个云基础设施。因此,在本文中我们提出 Sherlock,一种新颖的基于内容搜索(CoBS)架构,用于从图像与文档中提取附加信息。此处我们将附加信息存储于启用 Elasticsearch 的数据库中,从而有助于依据内容搜索所需数据。该方法分两个顺序阶段工作。首先,数据将被上传至分类器,由其判定数据类型并发送至对应数据类型的特定模型。其中上传的图像被送至我们训练的目标检测模型,文档则送至关键词提取模型。接下来,提取的信息被发送至 Elasticsearch,从而实现基于内容的搜索。由于模型精度对搜索正确性至关重要,我们使用综合数据集(多媒体数据用 Microsoft COCO Dataset,文档数据用 SemEval2017 Dataset)训练模型。此外,我们使用名为 OpenStack Swift 的开源 OSS 真实实现来测试所设计架构。我们将图像分多段上传至实现的数据库中,以探明所提模型在真实 Swift 对象存储中的效能。

关键词

引用

@article{arxiv.2303.02105,
  title  = {Sherlock in OSS: A Novel Approach of Content-Based Searching in Object Storage System},
  author = {Jannatun Noor and Rizwanul Haque Ratul and Mir Rownak Ali Uday and Joyanta Jyoti Mondal and Md. Sadiqul Islam Sakif and A. B. M. Alim Al Islam},
  journal= {arXiv preprint arXiv:2303.02105},
  year   = {2023}
}

备注

13 Pages, 9 Figures, Submitted to IEEE Transactions on Parallel and Distributed Systems for possible publication. arXiv admin note: substantial text overlap with arXiv:1306.3075 by other authors; substantial text overlap with arXiv:1910.05786 by other authors without attribution