MENTOR:面向类比学习的多语言文本检测
计算机视觉与模式识别
2024-03-13 v1
摘要
文本检测在基于视觉的移动机器人需要解释其周围文本以执行给定任务时经常使用。例如,在多语言城市的送货机器人需要能够进行多语言文本检测,以便机器人能够读取交通标志和路标。此外,目标语言会因地区而异,这意味着需要高效地重新训练模型以识别新出现的语言。然而,为新语言收集和标记训练数据的工作量较大,重新训练现有/已训练文本检测器的努力也相当可观。更糟糕的是,这种常规做法会在每次出现新语言时重复进行。这促使我们提出一种更有效地解决上述挑战的新问题设置:“我们请求一个通用的多语言文本检测框架,用于在场景图像中检测并识别已见和未见语言区域,而无需为未见语言收集监督训练数据或重新训练模型”。为此,我们提出了MENTOR,即第一个实现零射取学习与少量射取学习之间学习策略的多语言场景文本检测方法。
引用
@article{arxiv.2403.07286,
title = {MENTOR: Multilingual tExt detectioN TOward leaRning by analogy},
author = {Hsin-Ju Lin and Tsu-Chun Chung and Ching-Chun Hsiao and Pin-Yu Chen and Wei-Chen Chiu and Ching-Chun Huang},
journal= {arXiv preprint arXiv:2403.07286},
year = {2024}
}
备注
8 pages, 4 figures, published to IROS 2023