LLM Dataset · 大模型数据

面向 LLM 指令 · 偏好 · 评测数据

为大模型预训练、SFT 指令微调、RLHF 偏好对齐与安全评测提供成套数据基础设施,所有标签均经过多轮人审与跨标注员一致性检验

20B + 数据量 30w+ 指令对 40+ 场景
rlhf.preference pair eval ●κ 0.84
Prompt 帮我把这段中文翻译成英文,要求自然、专业、面向商业客户。
Response · A
自然流畅的商业表达,保留语意层次,词汇符合 B2B 沟通场景。
Chosen · 4 / 5helpful · honest
Response · B
直译痕迹明显,部分行业术语未做归一化,整体偏生硬。
Rejected · 2 / 5literal · stiff
标注为 A > B · 双盲一致 κ 0.84
01 · Pipeline

完整LLM 数据管线

从原始语料清洗到偏好对齐与红队评测,每一步都形成独立可交付的子集

01 · Pretrain

预训练语料

多源去重、质量分级与有毒过滤后的多语种、多领域语料库

raw →clean
02 · SFT

指令微调

多任务指令+ 高质量人写回答,覆盖通用与垂直任务模板

instruction
03 · RLHF

偏好对比

同一 Prompt 多回答双盲对比,输出 Chosen / Rejected 偏好对

preference
04 · Eval

评测打分

多维度评分(有用 / 真实 / 安全 / 一致),适配在线评测平台

rubric
05 · Safety

红队 & 安全

对抗 Prompt、越狱场景与敏感类目的红队样本与人工评估

red-team
03 · Compatible

兼容主流训练框架

所有数据集均提供 JSONL / Parquet 双格式 + 训练 schema 文档,可在主流框架下直接使用

DeepSpeedjsonl
Megatron-LMparquet
LLaMA-Factoryalpaca
trl / TRLXpref
Axolotlchatml
LMDeployeval
Next Step

开启大模型数据合作