青少年数据集搜集
青少年数据集
1.ChildGuard(多国:澳大利亚、阿联酋、印度、沙特、美国)
针对儿童/青少年的仇恨言论数据集,包含351,877条标注实例,来自X(Twitter)、Reddit和YouTube,覆盖三个年龄段(13-17岁青少年、11-12岁前青少年、11岁以下儿童)。
ChildGuard是一个大型的、经过精心整理的数据集,包含超过35万条多语言社交媒体帖子,这些帖子均经过标注,专门针对儿童的仇恨言论,并配有详细的年龄段标签、上下文和词汇特征,以及严谨的专家标注,旨在支持对检测和减轻针对儿童的网络虐待的研究。
核心关注:针对儿童和青少年的仇恨言论,包括针对年龄、外貌、种族、国籍和残疾的攻击。包含情境子集(157K) 和词汇子集(194K) 两个子集。
ChildGuard包含351,877 个标注实例,这些实例收集自Reddit、X(原 Twitter)和YouTube。
论文地址:https://arxiv.org/abs/2506.21613
数据集地址:https://github.com/gskgautam/ChildGuard
2.DeTox-Datase(德国)
公开可用的攻击性语言数据集(DeTox-dataset),其中包含10,278条标注过的德语社交媒体评论。标签特别侧重于评论的有害性、刑事相关性以及歧视类型。
论文:A Comprehensive Dataset for German Offensive Language and Conversation Analysis
数据集地址:https://github.com/hdaSprachtechnologie/detox
3.Hateful Messages: A Conversational Data Set of Hate Speech produced by Adolescents on Discord(论文,数据集不公开)
随着社交媒体的兴起,仇恨内容也随之增多。尽管人们对仇恨言论的理解和定义各不相同,但平台、社群和立法机构都承认这一问题的存在。因此,青少年已成为社交媒体用户中一个新兴且活跃的群体。大多数青少年都经历过或目睹过网络仇恨言论。自动化仇恨言论分类领域的研究正在蓬勃发展,其研究重点包括偏差、泛化性和性能等。为了提高泛化性和性能,了解数据中的偏差至关重要。本研究旨在解决仇恨言论分类中青少年语言的偏差问题,并提供了一个包含88,395条带标注聊天信息的现代化匿名仇恨言论青少年语言数据集。该数据集包含来自聊天平台Discord的公开在线消息。
论文地址:https://arxiv.org/abs/2309.01413
数据集:未公开
4. ALONE(美国)
面向青少年(高中生)的多模态毒性行为数据集,包含推文、图片、表情符号及相关元数据,基于用户间的交互(interaction)进行标注,而非单条推文。
论文:ALONE: A Dataset for Toxic Behavior among Adolescents on Twitter
论文地址:https://arxiv.org/abs/2008.06465
数据集地址:需联系作者申请(https://aiisc.cse.sc.edu/opensource/Terms%20of%20Use%20ALONE.pdf)
5. GoEmotions(美国)
目前最大规模的人工标注细粒度情感数据集,包含58,009条Reddit评论,标注为27种情绪类别或中性。
论文:GoEmotions: A Dataset of Fine-Grained Emotions
论文地址:https://aclanthology.org/2020.acl-main.372/
数据集地址:https://github.com/google-research/google-research/tree/master/goemotions
6. Chinese “Youth-toxicity” Dataset(中国)
首个中国青少年毒性内容数据集(ICWSM’26),通过YouthLens采集程序招募66名13-21岁中国青少年参与15天数据收集,研究表明青少年对毒性内容的感知与内容来源及文本元属性等多种因素相关。
论文:“Harmless to You, Hurtful to Me!”: Investigating the Detection of Toxic Languages Grounded in the Perspective of Youth
论文地址:https://arxiv.org/abs/2508.02094
数据集地址:未公开
7.HateXplain(印度)
目前较为经典的可解释仇恨言论数据集,包含超过2万条社交媒体文本,标注为 Hate Speech(仇恨言论)、Offensive(攻击性言论)和 Normal(正常文本),同时提供人工标注的解释依据(Rationale),适用于研究网络暴力、群体对立、民族歧视和情绪煽动。
论文: HateXplain: A Benchmark Dataset for Explainable Hate Speech Detection
论文地址:
https://ojs.aaai.org/index.php/AAAI/article/view/17745
数据集地址:
https://github.com/hate-alert/HateXplain
8. OLID(英国)
Offensive Language Identification Dataset 是 SemEval-2019 官方竞赛数据集,包含约1.4万条 Twitter 文本,标注为 Offensive、Targeted Insult、Untargeted 等类别,广泛应用于网络攻击性语言识别、网络暴力和内容审核研究。
论文: SemEval-2019 Task 6: Identifying and Categorizing Offensive Language in Social Media (OffensEval)
论文地址:
https://aclanthology.org/S19-2010/
数据集地址:
https://gitee.com/hf-datasets/OLID
9. Jigsaw Toxic Comment Classification(美国)
Google Jigsaw 发布的经典有害评论数据集,包含约16万条维基百科评论,标注为 Toxic、Severe Toxic、Obscene、Threat、Insult、Identity Hate 等多个类别,广泛应用于网络暴力、有害内容检测和内容安全研究。
论文: Challenges in Toxic Comment Classification
论文地址:
https://arxiv.org/abs/1903.04561
数据集地址:
https://www.kaggle.com/competitions/jigsaw-toxic-comment-classification-challenge
10. SCAYS(中国)
从小红书采集的中文青少年情感语料库,包含30,182条句子级标注数据(三分类:负面/中性/正面),覆盖2个维度、46个关键词。
数据集地址:https://github.com/LexuanWang-Michelle/SCAYS
11.**CCD (中国,基于会话的中文网络欺凌检测数据集)**:
首个基于会话(session-based) 的中文网络欺凌数据集。数据来自微博,包含677个会话和38,999条评论,对欺凌严重程度进行了分级(轻/中/重度)。该数据集对每条评论做了是否欺凌、显式/隐式、是否讽刺、针对个人/群体、群体类型等细粒度标注。
数据集地址:https://github.com/STAIR-BUPT/SCCD
12.IMPACTeen(波兰/多国)
面向青少年社会影响力检测的数据集,涵盖人际、媒体和数字环境中的青少年社交影响场景。包含1,021篇文本、5,100条独立标注记录,每篇文本从青少年、家长、心理学家、沟通专家、教师五个视角进行标注。数据集以波兰语创建,并提供对应的英文版本。
核心关注:意图、操纵、说服及其在青少年交流中的后果。多维度标注涵盖影响力存在性、技术手段、意图、后果、抵抗性、反应和标注置信度。
论文地址:https://arxiv.org/abs/2606.16910
数据集地址:https://zenodo.org/records/20703617
13. KoACD(韩国)
首个韩国青少年认知扭曲大规模数据集,包含108,717条实例。认知扭曲指可能导致青少年抑郁和焦虑等心理健康问题的消极思维模式。
核心关注:青少年认知扭曲与心理健康——检测可能导致心理问题的消极思维模式。
主要用于(二)语言暴力/心理健康和(四)未成年人心理健康。
论文地址:https://arxiv.org/abs/2505.00367
数据集地址:https://github.com/cocoboldongle/KoACD
14. The Value of Nothing(多国)
从TikTok influencers视频中提取隐含人类价值观的数据集。包含885个TikTok视频,由面向儿童和青少年的网红发布,依据Schwartz个人价值观理论进行标注。
核心关注:价值观植入与价值观塑造——社交媒体影响者如何通过视频内容向青少年传递和塑造价值观。
直接对应(一)价值观篡改/引导和(五)情感依赖/沉迷。可用于研究消费观植入(网红通过内容向青少年传递消费价值观)。
论文地址:https://arxiv.org/abs/2501.11770
数据集需向作者申请:邮箱 alinashitrit@mail.tau.ac.il
15. Weibo-Senti-100K(中国)
公开中文微博情感分析数据集,包含约12万条微博,标注为积极和消极两类情绪,是中文情感分析领域应用最广泛的数据集之一,可用于社交媒体情绪识别和舆情分析。
论文: 无官方论文
数据集地址:
https://github.com/SophonPlus/ChineseNlpCorpus/tree/master/datasets/weibo_senti_100k
16. SMP2020-EWECT 微博情绪分类数据集(中国)
由哈尔滨工业大学社会计算与信息检索研究中心发布,是国内影响力最大的微博情绪分类评测数据集之一。包含普通微博和疫情微博两部分,共约48,000条微博,标注为积极、愤怒、悲伤、恐惧、惊奇和无情绪六类,可用于研究网络情绪传播、公共舆情和青少年社交媒体情绪。
数据集地址:
https://github.com/BrownSweater/BERT_SMP2020-EWECT/tree/main/data/raw
17. Jigsaw Toxic Comment(美国)
Google Jigsaw 发布的经典有害评论数据集,包含约16万条维基百科评论,涵盖 Toxic、Threat、Identity Hate 等多个标签,是内容安全、网络暴力和评论审核研究的重要基准数据集。
包含不同类型的恶意内容,例如威胁、淫秽内容、侮辱和基于身份的仇恨言论
论文: Challenges in Toxic Comment Classification
论文地址:
https://arxiv.org/abs/1903.04561
**数据集地址:
**https://www.kaggle.com/competitions/jigsaw-toxic-comment-classification-challenge
18. FakeNewsNet(美国)
国际上最常用的虚假新闻检测数据集之一,由亚利桑那州立大学发布。数据集包含新闻正文、社交媒体传播信息、用户评论和传播网络,可用于研究虚假信息传播、认知塑造、舆论操控和信息可信度。
论文: FakeNewsNet: A Data Repository with News Content, Social Context and Dynamic Information for Studying Fake News on Social Media
论文地址:
https://arxiv.org/abs/1809.01286
数据集地址:
https://github.com/KaiDMML/FakeNewsNet
19. SMP2020-EWECT 微博情绪分类数据集(中国)
由哈尔滨工业大学社会计算与信息检索研究中心发布,是国内影响力最大的微博情绪分类评测数据集之一。包含普通微博和疫情微博两部分,共约48,000条微博,标注为积极、愤怒、悲伤、恐惧、惊奇和无情绪六类,可用于研究网络情绪传播、公共舆情和青少年社交媒体情绪。
数据集地址:
https://github.com/BrownSweater/BERT_SMP2020-EWECT/tree/main/data/raw



