中文

基于弱监督跨模态对比学习的场景文本检测

计算机视觉与模式识别 2025-01-14 v2 人工智能

摘要

文本检测旨在为给定查询找到相关论点。虽然现有方法仅依赖于查询和论点的语义对齐,但本次关于视角论点检索的首次共享任务将视角纳入检索过程,以考虑论证中的潜在影响。我们提出了一个新颖的多语言数据集,涵盖人口统计和社会文化(社会)变量,如年龄、性别和政治态度,代表了社会中的少数和多数群体。我们区分了三种场景,以探索检索系统如何考虑显式(在查询和语料库中)和隐式(仅在查询中)表达的视角。本文概述了该共享任务,并总结了六个提交系统的结果。我们发现,在实现视角主义方面存在巨大挑战,尤其是当仅基于论点文本进行个性化而不显式提供社会概况时。此外,检索系统倾向于偏向多数群体,但部分缓解了女性性别的偏见。虽然我们启动了视角论点检索,但进一步的研究对于优化检索系统以促进个性化和减少极化至关重要。

关键词

引用

@article{arxiv.2407.19507,
  title  = {WeCromCL: Weakly Supervised Cross-Modality Contrastive Learning for Transcription-only Supervised Text Spotting},
  author = {Jingjing Wu and Zhengyao Fang and Pengyuan Lyu and Chengquan Zhang and Fanglin Chen and Guangming Lu and Wenjie Pei},
  journal= {arXiv preprint arXiv:2407.19507},
  year   = {2025}
}

备注

Accepted by ECCV 2024