面向大模型的多模态训练数据平台 · 已上线

KunLun Dateset

AI 训练数据工厂 · 产品方案白皮书

把「数据准备」从一条脏活累活链,重塑为一条可编排、可复用、可校验的智能体工作流—— 从原始文档/图片导入,到知识库构建、分块、问答标注、SFT / DPO / COT 多模态训练集生成, 再到模型对话辅助标注与提示词模板化,让算法工程师专注数据质量,把脏活与样板活交给智能体。

内核KunLun Dateset 模态文本 + 图像 数据集SFT / DPO / COT 模型DeepSeek / 自定义 访问hqd.sanhuaai.com 形态Web + API
01 / EXEC

执行摘要

大模型训练最大的瓶颈不是模型,而是高质量、合规、可追溯的训练数据。KunLun Dateset 是面向 LLM / VLM 团队的一站式训练数据工厂:从原始语料到 SFT/DPO/COT 数据集,全流程在一个工作台完成。

A全流程在一个工作台

知识库 → 分块 → 问答标注 → 数据集生成 → 模型对话辅助标注 → 导出。告别在 Notion、Excel、脚本之间来回切换。

B多模态原生

文本与图像在同一个项目里走完导入、分块、标注、生成的完整闭环,专为多模态大模型训练场景设计。

C三种主流训练集

预训练语料、SFT 指令微调、DPO 偏好对齐,并内置 COT 思维链模板;统一数据契约,可直接送入训练框架。

D提示词即资产

所有标注、生成、评估的 Prompt 沉淀为可复用模板;改一次 prompt,全项目生效,且支持版本化审计。

02 / CONTEXT

行业背景

2024 年以来,行业焦点从「模型架构」转向「数据配方」。但实际团队里,数据准备仍占项目 60% 以上工时,且严重依赖个人经验。

①数据脏活没人爱干

清洗、分块、格式转换、QA 标注——脏、累、重复,且需要懂业务又懂模型的复合人才。

②流程黑盒难审计

数据从「原始」到「可训练」经过多少步、哪些 prompt、哪些人改过——传统脚本式管线无法回答。

③多模态拼装代价高

文本与图像往往在两个工具里准备,最后用脚本拼装——一致性、可追溯性、版本管理都很难。

④模型换了数据要重做

换底座模型往往意味着 prompt 模板、对话格式、评估标准全部重做——资产没有沉淀。

03 / VISION

定位与愿景

我们要把训练数据从「项目级一次性产物」升级为「企业级可复用资产」——每一条数据都带着它的来龙去脉,每一套 prompt 都能跨项目复用。

●产品定位

面向 LLM / VLM 团队的训练数据中台。不是又一个标注众包平台,而是「数据生产线 + 资产库 + 协作台」三位一体。

●目标客户

大模型初创团队、企业 AI 中台、AI 解决方案集成商、垂直行业 LLM 团队、研究机构。

●一年愿景

成为「中文 + 多模态」领域最易用的训练数据生产线;让 5 人算法团队也能一周搭起可投产的 SFT 数据流水线。

●三年愿景

训练数据从「自己造」走向「市场买」——KunLun Dateset 成为多模态训练数据的标准化载体与流通平台。

04 / CAPABILITY

核心能力

8 大能力模块,覆盖训练数据全生命周期。

📄知识库管理

文档 / 图片统一导入;自动 OCR、向量化、版本管理;支持权限隔离与团队共享。

✂️智能分块

文档按语义分块、图像按区域分块;规则 + LLM 混合策略,可视化校对。

❓问答标注

基于知识库自动生成 QA 对,人工校对 + 多人协作审核;导出为 SFT 指令数据。

🗃️数据集构建

预训练语料 / SFT 指令 / DPO 偏好对 / COT 思维链四类,一键生成与导出。

💬模型对话

对接 DeepSeek 等多种底座,对话即标注:可把对话回合直接转成 SFT / DPO 数据。

✨AI 对话

让大模型当数据助工:自动扩写、自动纠错、自动评估标注质量。

🧩提示词模板

所有 prompt 沉淀为模板,支持变量、版本、AB 测试;改一处全项目生效。

👥项目协作

项目级成员 / 角色 / 权限;管理员、标注员、审核员分工;操作全程可追溯。

05 / FEATURES

功能全景

8 大模块、40+ 功能点,覆盖训练数据从「原始」到「可训练」的全生命周期。

📄知识库管理

  • PDF / Word / Markdown / 图片批量导入
  • 自动 OCR + 向量化 + 全文索引
  • 文档版本管理 · 标签体系 · 权限隔离
  • 语义检索:混合检索 + 重排

✂️智能分块

  • 按标题 / 段落 / 语义三层分块策略
  • 图像区域分块 · LLM 校准
  • 分块可视化校对 · 手动微调
  • 分块结果一键复用 / 重新切分

❓问答标注

  • 基于知识库自动生成 QA 对
  • 批量筛选 · 改写建议 · 去重合并
  • 多人协作 + 审核流
  • 质量评分 · 一键导出 SFT 指令

🗃️数据集构建

  • 预训练语料 / SFT / DPO / COT 四类
  • 字段映射 · 数据配比控制
  • 样本去重 · 平衡采样 · 格式校验
  • JSONL / Parquet / HF Datasets 导出

💬模型对话

  • DeepSeek / OpenAI / Anthropic 多底座
  • 对话回合直接转 SFT / DPO 数据
  • 上下文注入知识库检索结果
  • 对话成本统计 · 用量看板

✨AI 对话

  • 自动扩写 · 自动纠错 · 润色
  • 标注质量自动评估
  • 数据翻译 / 分类 / 摘要
  • 批处理任务编排与重试

🧩提示词模板

  • 模板变量 · 条件分支 · 嵌套引用
  • 版本历史 · 回滚 · AB 对比
  • 跨项目复用 · 权限控制
  • 模板效果评估与审计

👥项目协作

  • 项目级 RBAC:管理员 / 标注员 / 审核员
  • 操作全程审计日志
  • 数据看板:进度 · 质量 · 产出统计
  • SSO / OIDC 企业登录
06 / ADVANTAGE

平台优势

性能、安全、成本与生态——为什么选择 KunLun Dateset 而不是脚本 + Excel、通用标注平台或纯向量库。

10万+
单项目文档容量
异步批量管线支撑
<100ms
向量检索响应
Qdrant 混合检索
40+
功能点
8 大模块全覆盖
5min
私有化上线
docker compose 一条命令

🚀性能与规模

异步批量导入与分块管线,单项目支撑 10 万级文档;向量 + 全文混合检索,响应毫秒级。

🔒安全与合规

完全私有化部署,数据不出内网;项目级 RBAC + 全程审计日志;支持 SSO / OIDC。

💰总拥有成本低

开源自托管,无按量授权费;单机 docker compose 即可运行,不依赖外部 SaaS。

🔌模型开放接入

DeepSeek / OpenAI / Anthropic / 本地 vLLM / Ollama 统一适配层,换模型不换流程。

🧬数据资产化

提示词模板、数据集版本、QA 语料跨项目复用;数据从「一次性产物」变「可沉淀资产」。

🖱️零代码易用

Web 可视化完成全部操作;模板化标注、批处理、一键导出,业务人员也能上手。

🔧可扩展架构

RESTful API + Webhook 事件;解析器、分块策略、导出格式均可插件化扩展。

🏢企业级就绪

多项目多租户、健康检查、Prometheus 指标、结构化日志,可直接进生产环境。

07 / FLOW

从原始语料到训练集:7 步流水线

一条数据从上传到可训练,全程 7 步;每一步都可独立暂停、复用、审计。

① 导入文档 / 图片 / URL
→
② 知识库OCR + 向量化
→
③ 分块语义切分
→
④ 问答QA 标注
→
⑤ 数据集SFT / DPO / COT
→
⑥ 模型对话辅助校验
→
⑦ 导出JSONL / Parquet
08 / ARCH

技术架构

分层架构,模块化部署,适配从单团队到企业级的不同规模。

FRONTEND
Next.js + Ant Design
React 19 / TypeScript / SSR
API
NestJS + Prisma
RESTful / OpenAPI 文档
DATA
PostgreSQL + Qdrant
关系 + 向量双引擎
DEPLOY
Docker Compose
单机一键 / 集群可扩

🔐权限与审计

项目级 RBAC;所有写操作落审计日志;支持 SSO / OIDC 接入。

🔌模型适配

对接 DeepSeek、OpenAI、Anthropic、本地 vLLM/Ollama,统一调用层。

📦数据导出

JSONL / Parquet / HuggingFace Datasets 直传;字段映射可配置。

09 / DIFF

差异化优势

和「脚本+Excel」「通用标注平台」「纯向量数据库」相比,KunLun Dateset 提供的差异。

维度脚本+Excel 方案通用标注平台KunLun Dateset
上手成本高,需全栈能力中,需人工搬运低,开箱即用
多模态需自拼文本为主文本 + 图像原生
Prompt 资产化散落代码中无模板化 + 版本化
数据集类型自实现仅分类标注SFT/DPO/COT 全覆盖
审计与协作无基础完整 RBAC + 审计日志
私有化可受限完全私有化部署
10 / USER

用户旅程

一个 5 人算法团队,从零到产出可训练 SFT 数据集的真实一天。

⓪第 0 天 · 立项

管理员创建项目、邀请成员、配置模型与解析服务;标注员与审核员各就各位。

①第 1 天 · 导入

上传 2000 份 PDF 文档 + 500 张产品图;OCR 与向量化后台完成,无需值守。

②第 2 天 · 分块

采用「按标题分块 + LLM 校准」策略;可视化校对,1 人 4 小时搞定全部。

③第 3 天 · 问答

基于知识库自动生成 8000 对 QA;标注员筛选 + 改写,2 人协作,6 小时完成。

④第 4 天 · 对话

用模型对话辅助生成 1500 条 COT;提示词模板化复用,半天完成。

⑤第 5 天 · 导出

导出 1.2 万条 SFT 指令 + 800 条 DPO + 1500 条 COT;送入训练框架。

11 / DEPLOY

部署与运维

一条 docker compose 启动全部服务;支持本地开发、私有化部署、云上托管三种形态。

🐳一键启动

克隆代码 → 配置 .env → docker compose up -d → 5 分钟内可登录使用。

🔒私有化

数据不出内网;对接企业 LDAP;支持 GPU 节点本地化加速模型推理。

📈可观测

内置健康检查接口;与 Prometheus / Grafana 对接;日志结构化输出。

🛠️持续更新

月度版本发布;提供迁移脚本与升级路径;不破坏数据 schema。