产品
Data&Leaderboard
Xpert Studio
Data&Leaderboard_

在这里,我们展示的是已经打磨完成的数据集与我们支持的训练范式。 它们不是为"跑分"而生,而是为真实使用场景而构建。

  • RLVR & Agentic
  • Rubrics & Verifierharbor format
  • SFTgolden coldstart trajectory
  • Expert Evaluation
  • Private Workspace/Repo
Code & Agentic
数据说明书

Terminal RL Data(终端强化学习数据)

Coding AgentDevOps AutomationCLI Tool Use

由软件、运维、安全等领域专家设计真实终端任务,并在沙箱中逐条验证,提供可执行、可复现、可评分的强化学习轨迹。

更新于11/03/2026立即阅读说明书
数据说明书

UI/UX Design(网页设计与交互生成数据)

Webpage GenerationFrontend AgentMultimodal UI

记录从需求、多轮修改到可运行网页与视觉证据的完整轨迹,覆盖主流网页场景,用于多模态 UI 生成与前端 Agent 训练。

更新于16/07/2026立即阅读说明书
数据说明书

MCP(模型上下文协议数据)

Agentic WorkflowsBrowser Agent

专家原创构建多轮、跨工具与多跳推理任务,配套程序化验证环境,用于训练可靠的工具调用与 Agent 协作能力。

更新于03/03/2026立即阅读说明书
数据说明书

Harness trace(Agent 生产轨迹数据)

Long-Horizon AgentTool OrchestrationProduction Traces

一线工程师、研究员在、白领专家真实生产工作中留下的 Agent 会话轨迹,完整保留请求上下文、思维链与工具执行结果,覆盖长程自主执行、多智能体协作与多模态交互形态。

更新于28/08/2026
数据说明书

Code Harbor(Harbor 格式的代码任务数据)

CodingHarborExecutable Evaluation

由领域专家基于真实场景设计代码任务,并按照 Harbor 规范组织任务说明、运行环境、参考解与测试,形成可执行、可复现、可验证的数据,用于代码模型的训练与能力评测。

更新于28/08/2026
Work
服务介绍说明

GDPval(高经济价值白领任务)

Real-World TaskEconomic ValueVerifiable Rubric

由行业专家复现真实职业工作流,构建可执行、可验证、直接对齐经济价值的Agent评测与训练任务;依托结构化Rubric建立机器可执行的逐条判定机制,并以SOTA模型多次作答实测任务区分度,最终达成评分可解释、奖励信号可信赖、训练梯度充足的三重交付保障。

更新于15/02/2026
服务介绍说明

Private Repo(非公开软件工程资产)

把未公开的真实软件工程经验,转化为更少数据污染、更贴近真实研发环境的 Coding Agent 训练与评测资产。

更新于28/08/2026立即阅读说明书
Compute Use & GUI
数据说明书

ALE(真实工作流 Agent 评测数据)

Computer UseProfessional SoftwareVerifiable Tasks

行业专家围绕真实专业工作流构建可执行、可验证的 Agent 任务,覆盖专业软件操作与复杂成果交付,并通过参考产物、Rubric 与评估器核验执行过程和最终结果。

更新于28/08/2026
产品Data&Leaderboard
Xpert Studio
Data&Leaderboard_

在这里,我们展示的是已经打磨完成的数据集与我们支持的训练范式——它们不是为"跑分"而生,而是为真实使用场景而构建。 我们关注的不是让模型在基准测试上多拿 10%, 而是让模型在真实世界里少犯一次低级错误, 多理解一次隐含意图,多承担一份责任。

  • RLVR & Agentic
  • Rubrics & Verifierharbor format
  • SFTgolden coldstart trajectory
  • Expert Evaluation
  • Private Workspace/Repo
Code & Agentic
数据说明书

Terminal RL Data(终端强化学习数据)

Coding AgentDevOps AutomationCLI Tool Use

由软件、运维、安全等领域专家设计真实终端任务,并在沙箱中逐条验证,提供可执行、可复现、可评分的强化学习轨迹。

更新于11/03/2026立即阅读说明书
数据说明书

UI/UX Design(网页设计与交互生成数据)

Webpage GenerationFrontend AgentMultimodal UI

记录从需求、多轮修改到可运行网页与视觉证据的完整轨迹,覆盖主流网页场景,用于多模态 UI 生成与前端 Agent 训练。

更新于16/07/2026立即阅读说明书
数据说明书

MCP(模型上下文协议数据)

Agentic WorkflowsBrowser Agent

专家原创构建多轮、跨工具与多跳推理任务,配套程序化验证环境,用于训练可靠的工具调用与 Agent 协作能力。

更新于03/03/2026立即阅读说明书
数据说明书

Harness trace(Agent 生产轨迹数据)

Long-Horizon AgentTool OrchestrationProduction Traces

一线工程师、研究员在、白领专家真实生产工作中留下的 Agent 会话轨迹,完整保留请求上下文、思维链与工具执行结果,覆盖长程自主执行、多智能体协作与多模态交互形态。

更新于28/08/2026
数据说明书

Code Harbor(Harbor 格式的代码任务数据)

CodingHarborExecutable Evaluation

由领域专家基于真实场景设计代码任务,并按照 Harbor 规范组织任务说明、运行环境、参考解与测试,形成可执行、可复现、可验证的数据,用于代码模型的训练与能力评测。

更新于28/08/2026
Work
服务介绍说明

GDPval(高经济价值白领任务)

Real-World TaskEconomic ValueVerifiable Rubric

由行业专家复现真实职业工作流,构建可执行、可验证、直接对齐经济价值的Agent评测与训练任务;依托结构化Rubric建立机器可执行的逐条判定机制,并以SOTA模型多次作答实测任务区分度,最终达成评分可解释、奖励信号可信赖、训练梯度充足的三重交付保障。

更新于15/02/2026
服务介绍说明

Private Repo(非公开软件工程资产)

把未公开的真实软件工程经验,转化为更少数据污染、更贴近真实研发环境的 Coding Agent 训练与评测资产。

更新于28/08/2026立即阅读说明书
Compute Use & GUI
数据说明书

ALE(真实工作流 Agent 评测数据)

Computer UseProfessional SoftwareVerifiable Tasks

行业专家围绕真实专业工作流构建可执行、可验证的 Agent 任务,覆盖专业软件操作与复杂成果交付,并通过参考产物、Rubric 与评估器核验执行过程和最终结果。

更新于28/08/2026