多语言 Transformer 中降维技术的探索
计算与语言
2022-04-19 v1
摘要
无论在科学文献还是工业界,基于语义与上下文感知的自然语言处理方案近年来都日益重要。这些模型在处理复杂语言理解任务(从对话代理到社交网络中的虚假信息治理)时所展现的可能性和性能毋庸置疑。此外,开发多语言模型以应对语言瓶颈也受到相当关注。对实现所有这些特征的更复杂模型的需求增长,伴随着其规模的增大,且在所需维度数量上并不节制。本文旨在全面阐述多种降维技术对不同最先进多语言 Siamese Transformer 性能的影响,包括无监督降维技术如线性和非线性特征提取、特征选择以及流形技术。为评估这些技术的效果,我们采用了语义文本相似度基准的多语言扩展版(mSTSb)和两种不同基线方法,一种使用若干模型的预训练版本,另一种使用其微调的 STS 版本。结果证明,分别可实现维度数量平均降低 和 。本工作也考虑了降维用于可视化的后果。本研究结果将显著有助于理解不同调优方法如何影响语义感知任务上的性能,以及降维技术如何处理为 STS 任务计算的高维嵌入及其在极高要求 NLP 任务上的潜力。
引用
@article{arxiv.2204.08415,
title = {Exploring Dimensionality Reduction Techniques in Multilingual Transformers},
author = {Álvaro Huertas-García and Alejandro Martín and Javier Huertas-Tato and David Camacho},
journal= {arXiv preprint arXiv:2204.08415},
year = {2022}
}
备注
22 pages, 4 figures and 8 tables