Text Dataset · 文本数据

NLP 训练 文本与对话数据集

面向 NER、关系抽取、意图识别、情感分类、对话与机器翻译等任务,覆盖 20+ 语种、12+ 任务场景,所有数据均经过多轮质检

10B + 条目 12+ 任务 20+ 语种
nlp.tagger ner + intent ●F1 0.946
[USR]张伟PER订一张从北京LOC上海LOC的高铁票,时间是3月18日DATE
[NLU]意图:book_train_ticket · 槽位 3 / 4 命中
[BOT]已为您查询到 12306ORG 18 日9:00 G1 次余票,是否确认下单
10B +条目
12+任务
20+语种
01 · Types

多类型文本数据

按 NLP 子任务划分的独立数据集,可单独授权或按需组合

NER & 关系抽取

覆盖通用与垂直领域命名实体识别、实体关系抽取等结构化抽取任务

50万样本
40+实体
PERORGLOC关系

意图与槽位

用户对话中的意图识别 + 槽位填充,适配智能客服、语音助手等对话系统

120万意图样本
200+意图
NLU多轮多领域

情感与观点

商品评论、社交媒体、客服对话中的情感倾向与方面级情感分析

200万样本
6 类情感
极性ABSA多语

对话语料

多轮人机对话与人人对话语料,支持开放域聊天与任务型对话训练

500万对话
50+场景
多轮角色任务

机器翻译平行语料

30+ 语种互译平行语料,含通用与垂类(法律、医疗、电商)翻译

1.2 亿句对
30+语种
中英中日欧语东南

分类与匹配

文本分类、相似度匹配、问答对匹配等基础任务的高质量训练集

300万样本
多任务覆盖
分类匹配蕴含
02 · Domains

垂直领域

包含术语库 + 领域内对话 + 领域内问答与抽取样本等

01金融22M token
02医疗18M token
03法律14M token
04电商30M token
05教育12M token
06客服25M token
07政务10M token
08汽车8M token
09旅游9M token
10娱乐11M token
11体育7M token
12科技20M token
03 · Languages

支持多语种

中文ZH EnglishEN 日本語JA 한국어KO FrançaisFR DeutschDE EspañolES PortuguêsPT РусскийRU العربيةAR Tiếng ViệtVI ภาษาไทยTH BahasaID हिन्दीHI
Next Step

获取文本数据