中文

面向语言可访问性的模板化文本到图像对齐:基于文本简化的可视化研究

计算与语言 2025-10-14 v1

摘要

拥有智力障碍者的人往往难以理解复杂文本。虽然许多文本到图像模型侧重美学,但如何将视觉图示与从中生成的文本简化(TS)关联仍不明确。本文提出一种结构化视觉语言模型(VLM)提示框架,用于从简化文本生成可访问图像。我们设计了五种提示模板,即 Basic Object Focus、Contextual Scene、Educational Layout、Multi-Level Detail 和 Grid Layout,每种模板遵循不同的空间布局,同时遵循可访问性约束,如对象数量限制、空间分离和内容限制。使用来自四个著名 TS 数据集(OneStopEnglish、SimPA、Wikipedia 和 ASSET)的400个句子级简化,我们进行了两阶段评估:阶段1评估提示模板的有效性(CLIPScore),阶段2由四位可访问性专家对生成图像进行人类标注(十种视觉风格)。结果表明,Basic Object Focus 提示模板在语义对齐方面取得最佳成绩,表明视觉简约主义可提升语言可访问性。专家评估进一步指出,Retro 风格最具可访问性,Wikipedia 数据源最有效。注释者之间的一致性在不同维度上存在差异,其中文本简约性表现出较强的可靠性,而图像质量则更具主观性。总体而言,本框架为可访问内容生成提供了实用指南,并凸显了结构化提示在 AI 生成视觉可访问性工具中的重要性。

关键词

引用

@article{arxiv.2510.11314,
  title  = {Template-Based Text-to-Image Alignment for Language Accessibility: A Study on Visualizing Text Simplifications},
  author = {Belkiss Souayed and Sarah Ebling and Yingqiang Gao},
  journal= {arXiv preprint arXiv:2510.11314},
  year   = {2025}
}