预训练语料
多源去重、质量分级与有毒过滤后的多语种、多领域语料库
raw →clean为大模型预训练、SFT 指令微调、RLHF 偏好对齐与安全评测提供成套数据基础设施,所有标签均经过多轮人审与跨标注员一致性检验
从原始语料清洗到偏好对齐与红队评测,每一步都形成独立可交付的子集
多源去重、质量分级与有毒过滤后的多语种、多领域语料库
raw →clean多任务指令+ 高质量人写回答,覆盖通用与垂直任务模板
instruction同一 Prompt 多回答双盲对比,输出 Chosen / Rejected 偏好对
preference多维度评分(有用 / 真实 / 安全 / 一致),适配在线评测平台
rubric对抗 Prompt、越狱场景与敏感类目的红队样本与人工评估
red-team所有数据集均提供 JSONL / Parquet 双格式 + 训练 schema 文档,可在主流框架下直接使用