TexIm FAST:基于 Transformer 的文本到图像表示用于语义相似性评估
计算与语言
2024-06-10 v1 人工智能
摘要
自然语言处理 (NLP) 的一个基本目标是从文本生成有意义的表示。提高表示信息性导致维度和内存占用的显著增长。这会导致下游模型复杂度的级联效应,增加其参数数量。现有技术无法应用于诸如文本到图像等的跨模态应用。为改善这些问题,本文提出了一种新颖的文本到图像方法,通过自监督变分自编码器 (VAE) 生成固定长度表示,用于语义评估应用 transformer (TexIm FAST)。这种图示表示允许无注意力推理,同时保留语言细节,在跨模态应用中效果显著。TexIm FAST 处理可变长度序列,生成固定长度表示,内存占用降低超过 75%。它通过减少参数数量来提高下游任务的效率。对 TexIm FAST 在语义文本相似性 (STS) 任务上的有效性进行了广泛分析,分别使用 MSRPC、CNN/Daily Mail 和 XSum 数据集。结果表明相较于基线模型,准确率提升约 6%,并展示了其处理异构长度序列(如文本与其摘要)进行比较的卓越能力。
关键词
引用
@article{arxiv.2406.04438,
title = {TexIm FAST: Text-to-Image Representation for Semantic Similarity Evaluation using Transformers},
author = {Wazib Ansar and Saptarsi Goswami and Amlan Chakrabarti},
journal= {arXiv preprint arXiv:2406.04438},
year = {2024}
}
备注
19 pages, 33 figures