TextAge:一个用于年龄分类的精选文本数据集
计算与语言
2024-06-26 v1 机器学习
摘要
与年龄相关的语言模式在理解语言差异和制定适龄沟通策略方面起着至关重要的作用。然而,缺乏全面多样的数据集阻碍了该领域的研究进展。为解决此问题,我们提出了TextAge,一个精选的文本数据集,将句子映射到其产生者的年龄和年龄组,以及未成年人(13岁以下)标签。TextAge涵盖了广泛的年龄范围,并包含来自CHILDES、Meta、JUSThink、Poki Poems-by-kids以及电视节目“Survivor”等多种来源的口语和书面数据。该数据集经过广泛的清洗和预处理,以确保数据质量和一致性。我们通过两个应用展示了TextAge的实用性:未成年人检测和代际分类。对于未成年人检测,我们训练了朴素贝叶斯分类器、微调的RoBERTa和XLNet模型,以区分未成年人和青年及以上人群的语言模式。对于代际分类,模型将语言模式分类到不同的年龄组(儿童、青少年、二十多岁等)。模型在“儿童”组中表现出色,但在“五十多岁”、“六十多岁”和“七十多岁”等较大年龄组中表现不佳,这可能是由于数据样本有限且语言差异不太明显。TextAge为研究年龄相关语言模式和开发年龄敏感的语言模型提供了宝贵的资源。该数据集的多样性和分类任务的显著结果凸显了其在内容审核、定向广告和适龄沟通等应用中的潜力。未来工作将进一步扩展数据集并探索更先进的建模技术。
关键词
引用
@article{arxiv.2406.16890,
title = {TextAge: A Curated and Diverse Text Dataset for Age Classification},
author = {Shravan Cheekati and Mridul Gupta and Vibha Raghu and Pranav Raj},
journal= {arXiv preprint arXiv:2406.16890},
year = {2024}
}