基于多模态特征的端侧文档分类
计算机视觉与模式识别
2021-01-07 v1 计算与语言
摘要
从小的截图到大的视频,文档占据了现代智能手机的大量空间。手机中的文档可从多种来源累积,且凭借手机的高存储容量,短时间内便会累积数百份文档。然而,搜索或管理文档仍是一项繁重的任务,因为大多数搜索方法依赖于元数据或仅依赖文档中的文本。在本文中,我们展示单一模态不足以分类,并提出一种在端侧分类文档的新流程,从而防止任何私有用户数据传输至服务器。为此,我们将一个开源的光学字符识别(OCR)库与我们的新型模型架构集成于该流程中。我们针对尺寸优化模型,这是端侧推理的必要指标。我们使用标准多模态数据集 FOOD-101 对分类模型进行基准测试,并以 30% 的模型压缩率展示了与先前 State of the Art 具竞争力的结果。
引用
@article{arxiv.2101.01880,
title = {On-Device Document Classification using multimodal features},
author = {Sugam Garg and Harichandana and Sumit Kumar},
journal= {arXiv preprint arXiv:2101.01880},
year = {2021}
}
备注
8th ACM IKDD CODS and 26th COMAD 2-4 January 2021