把「数据准备」从一条脏活累活链,重塑为一条可编排、可复用、可校验的智能体工作流—— 从原始文档/图片导入,到知识库构建、分块、问答标注、SFT / DPO / COT 多模态训练集生成, 再到模型对话辅助标注与提示词模板化,让算法工程师专注数据质量,把脏活与样板活交给智能体。
大模型训练最大的瓶颈不是模型,而是高质量、合规、可追溯的训练数据。KunLun Dateset 是面向 LLM / VLM 团队的一站式训练数据工厂:从原始语料到 SFT/DPO/COT 数据集,全流程在一个工作台完成。
知识库 → 分块 → 问答标注 → 数据集生成 → 模型对话辅助标注 → 导出。告别在 Notion、Excel、脚本之间来回切换。
文本与图像在同一个项目里走完导入、分块、标注、生成的完整闭环,专为多模态大模型训练场景设计。
预训练语料、SFT 指令微调、DPO 偏好对齐,并内置 COT 思维链模板;统一数据契约,可直接送入训练框架。
所有标注、生成、评估的 Prompt 沉淀为可复用模板;改一次 prompt,全项目生效,且支持版本化审计。
2024 年以来,行业焦点从「模型架构」转向「数据配方」。但实际团队里,数据准备仍占项目 60% 以上工时,且严重依赖个人经验。
清洗、分块、格式转换、QA 标注——脏、累、重复,且需要懂业务又懂模型的复合人才。
数据从「原始」到「可训练」经过多少步、哪些 prompt、哪些人改过——传统脚本式管线无法回答。
文本与图像往往在两个工具里准备,最后用脚本拼装——一致性、可追溯性、版本管理都很难。
换底座模型往往意味着 prompt 模板、对话格式、评估标准全部重做——资产没有沉淀。
我们要把训练数据从「项目级一次性产物」升级为「企业级可复用资产」——每一条数据都带着它的来龙去脉,每一套 prompt 都能跨项目复用。
面向 LLM / VLM 团队的训练数据中台。不是又一个标注众包平台,而是「数据生产线 + 资产库 + 协作台」三位一体。
大模型初创团队、企业 AI 中台、AI 解决方案集成商、垂直行业 LLM 团队、研究机构。
成为「中文 + 多模态」领域最易用的训练数据生产线;让 5 人算法团队也能一周搭起可投产的 SFT 数据流水线。
训练数据从「自己造」走向「市场买」——KunLun Dateset 成为多模态训练数据的标准化载体与流通平台。
8 大能力模块,覆盖训练数据全生命周期。
文档 / 图片统一导入;自动 OCR、向量化、版本管理;支持权限隔离与团队共享。
文档按语义分块、图像按区域分块;规则 + LLM 混合策略,可视化校对。
基于知识库自动生成 QA 对,人工校对 + 多人协作审核;导出为 SFT 指令数据。
预训练语料 / SFT 指令 / DPO 偏好对 / COT 思维链四类,一键生成与导出。
对接 DeepSeek 等多种底座,对话即标注:可把对话回合直接转成 SFT / DPO 数据。
让大模型当数据助工:自动扩写、自动纠错、自动评估标注质量。
所有 prompt 沉淀为模板,支持变量、版本、AB 测试;改一处全项目生效。
项目级成员 / 角色 / 权限;管理员、标注员、审核员分工;操作全程可追溯。
8 大模块、40+ 功能点,覆盖训练数据从「原始」到「可训练」的全生命周期。
性能、安全、成本与生态——为什么选择 KunLun Dateset 而不是脚本 + Excel、通用标注平台或纯向量库。
异步批量导入与分块管线,单项目支撑 10 万级文档;向量 + 全文混合检索,响应毫秒级。
完全私有化部署,数据不出内网;项目级 RBAC + 全程审计日志;支持 SSO / OIDC。
开源自托管,无按量授权费;单机 docker compose 即可运行,不依赖外部 SaaS。
DeepSeek / OpenAI / Anthropic / 本地 vLLM / Ollama 统一适配层,换模型不换流程。
提示词模板、数据集版本、QA 语料跨项目复用;数据从「一次性产物」变「可沉淀资产」。
Web 可视化完成全部操作;模板化标注、批处理、一键导出,业务人员也能上手。
RESTful API + Webhook 事件;解析器、分块策略、导出格式均可插件化扩展。
多项目多租户、健康检查、Prometheus 指标、结构化日志,可直接进生产环境。
一条数据从上传到可训练,全程 7 步;每一步都可独立暂停、复用、审计。
分层架构,模块化部署,适配从单团队到企业级的不同规模。
项目级 RBAC;所有写操作落审计日志;支持 SSO / OIDC 接入。
对接 DeepSeek、OpenAI、Anthropic、本地 vLLM/Ollama,统一调用层。
JSONL / Parquet / HuggingFace Datasets 直传;字段映射可配置。
和「脚本+Excel」「通用标注平台」「纯向量数据库」相比,KunLun Dateset 提供的差异。
| 维度 | 脚本+Excel 方案 | 通用标注平台 | KunLun Dateset |
|---|---|---|---|
| 上手成本 | 高,需全栈能力 | 中,需人工搬运 | 低,开箱即用 |
| 多模态 | 需自拼 | 文本为主 | 文本 + 图像原生 |
| Prompt 资产化 | 散落代码中 | 无 | 模板化 + 版本化 |
| 数据集类型 | 自实现 | 仅分类标注 | SFT/DPO/COT 全覆盖 |
| 审计与协作 | 无 | 基础 | 完整 RBAC + 审计日志 |
| 私有化 | 可 | 受限 | 完全私有化部署 |
一个 5 人算法团队,从零到产出可训练 SFT 数据集的真实一天。
管理员创建项目、邀请成员、配置模型与解析服务;标注员与审核员各就各位。
上传 2000 份 PDF 文档 + 500 张产品图;OCR 与向量化后台完成,无需值守。
采用「按标题分块 + LLM 校准」策略;可视化校对,1 人 4 小时搞定全部。
基于知识库自动生成 8000 对 QA;标注员筛选 + 改写,2 人协作,6 小时完成。
用模型对话辅助生成 1500 条 COT;提示词模板化复用,半天完成。
导出 1.2 万条 SFT 指令 + 800 条 DPO + 1500 条 COT;送入训练框架。
一条 docker compose 启动全部服务;支持本地开发、私有化部署、云上托管三种形态。
克隆代码 → 配置 .env → docker compose up -d → 5 分钟内可登录使用。
数据不出内网;对接企业 LDAP;支持 GPU 节点本地化加速模型推理。
内置健康检查接口;与 Prometheus / Grafana 对接;日志结构化输出。
月度版本发布;提供迁移脚本与升级路径;不破坏数据 schema。