中文

Syn3DTxt:用于场景文本生成的三维线索嵌入

计算机视觉与模式识别 2025-05-27 v1

摘要

本研究旨在调查合成数据集中场景文本渲染所需的三维上下文不足的挑战。尽管扩散模型和相关技术的最新进展改善了场景文本生成的某些方面,但大多数现有方法仍然依赖2D数据,从电影海报和书籍封面获取真实训练样本,这限制了它们捕捉真实场景中空间布局和视觉效果之间复杂交互的能力。特别地,传统2D数据集不提供将文本准确嵌入多样化背景所需的几何线索。为解决这一局限,我们提出了一种构建合成数据集的新标准,通过加入表面法线来丰富三维场景特征。通过在传统2D数据中添加表面法线,我们的方法旨在增强空间关系的表示,并为未来的场景文本渲染方法提供更坚实的基础。大量实验表明,在此新标准下构建的数据集提供了改进的几何上下文,促进了在复杂三维空间条件下文本渲染的进一步进展。

关键词

引用

@article{arxiv.2505.18479,
  title  = {Syn3DTxt: Embedding 3D Cues for Scene Text Generation},
  author = {Li-Syun Hsiung and Jun-Kai Tu and Kuan-Wu Chu and Yu-Hsuan Chiu and Yan-Tsung Peng and Sheng-Luen Chung and Gee-Sern Jison Hsu},
  journal= {arXiv preprint arXiv:2505.18479},
  year   = {2025}
}

备注

CVPR workshop 2025: SyntaGen