中文

图像描述生成中低分辨率图像潜在嵌入的孪生驱动优化

计算机视觉与模式识别 2025-12-10 v1 人工智能 人机交互

摘要

图像描述生成在许多领域至关重要,包括辅助视障人士、改进内容管理系统以及增强人机交互。然而,该领域近期面临的一个挑战是处理低分辨率图像(LRI)。虽然使用更大的模型(如Transformer)进行编码可以提升性能,但这些模型通常体积庞大,需要大量计算资源和内存,导致重新训练面临困难。为解决这一问题,提出了一种名为SOLI(Siamese-Driven Optimization for Low-Resolution Image Latent Embedding in Image Captioning)的方法,专门针对轻量级低分辨率图像描述生成而设计。该方法采用孪生网络架构来优化潜在嵌入,提升图像到文本转换过程的效率与准确性。通过聚焦于双路径神经网络结构,SOLI在不牺牲性能的前提下最小化了计算开销,使其成为资源受限场景下训练的理想选择。

关键词

引用

@article{arxiv.2512.08873,
  title  = {Siamese-Driven Optimization for Low-Resolution Image Latent Embedding in Image Captioning},
  author = {Jing Jie Tan and Anissa Mokraoui and Ban-Hoe Kwan and Danny Wee-Kiat Ng and Yan-Chai Hum},
  journal= {arXiv preprint arXiv:2512.08873},
  year   = {2025}
}

备注

6 pages