FreeTxt-Vi:面向分段、情感与概括的越南语-英语双语工具包
计算与语言
2026-03-09 v1
摘要
FreeTxt-Vi 是一个免费且开源的基于网页的工具包,用于创建和分析双语越南语-英语文本集合。它位于语料库语言学与自然语言处理(NLP)的交叉领域,使无需编程专业知识的用户能够构建、探索和解读自由文本数据。该系统将语料库分析功能(如 concordancing、关键词分析、词汇关系探索和交互式可视化)与基于转换器的 NLP 组件(用于情感分析和概括)相结合。本工作的关键贡献是设计一种统一的双语 NLP 管道,集成混合 VnCoreNLP 和字节对编码(BPE)分段策略、经过微调的 TabularisAI 情感分类器以及经过微调的 Qwen2.5 模型用于抽象概括。与现有文本分析平台不同,FreeTxt-Vi 被评估为一组语言处理组件。我们进行了涵盖分段、情感分析和概括的三部分评估,表明该方法在越南语和英语中均实现了与广泛使用的基线的竞争或优越性能。通过降低多语言文本分析的技术门槛,FreeTxt-Vi 支持可重复研究,促进越南语(一个在 NLP 领域被低估的广泛使用语言)的语言资源发展。该工具包适用于包括教育、数字人文、文化遗产和社会科学等领域,这些领域常有大量难以规模化处理的定性文本数据。
引用
@article{arxiv.2603.05690,
title = {FreeTxt-Vi: A Benchmarked Vietnamese-English Toolkit for Segmentation, Sentiment, and Summarisation},
author = {Hung Nguyen Huy and Mo El-Haj and Dawn Knight and Paul Rayson},
journal= {arXiv preprint arXiv:2603.05690},
year = {2026}
}
备注
10 pages