Harness trace(Agent 生产轨迹数据)
一线工程师、研究员在、白领专家真实生产工作中留下的 Agent 会话轨迹,完整保留请求上下文、思维链与工具执行结果,覆盖长程自主执行、多智能体协作与多模态交互形态。
在这里,我们展示的是已经打磨完成的数据集与我们支持的训练范式。 它们不是为"跑分"而生,而是为真实使用场景而构建。
由软件、运维、安全等领域专家设计真实终端任务,并在沙箱中逐条验证,提供可执行、可复现、可评分的强化学习轨迹。
记录从需求、多轮修改到可运行网页与视觉证据的完整轨迹,覆盖主流网页场景,用于多模态 UI 生成与前端 Agent 训练。
专家原创构建多轮、跨工具与多跳推理任务,配套程序化验证环境,用于训练可靠的工具调用与 Agent 协作能力。
一线工程师、研究员在、白领专家真实生产工作中留下的 Agent 会话轨迹,完整保留请求上下文、思维链与工具执行结果,覆盖长程自主执行、多智能体协作与多模态交互形态。
由领域专家基于真实场景设计代码任务,并按照 Harbor 规范组织任务说明、运行环境、参考解与测试,形成可执行、可复现、可验证的数据,用于代码模型的训练与能力评测。
由行业专家复现真实职业工作流,构建可执行、可验证、直接对齐经济价值的Agent评测与训练任务;依托结构化Rubric建立机器可执行的逐条判定机制,并以SOTA模型多次作答实测任务区分度,最终达成评分可解释、奖励信号可信赖、训练梯度充足的三重交付保障。
把未公开的真实软件工程经验,转化为更少数据污染、更贴近真实研发环境的 Coding Agent 训练与评测资产。
行业专家围绕真实专业工作流构建可执行、可验证的 Agent 任务,覆盖专业软件操作与复杂成果交付,并通过参考产物、Rubric 与评估器核验执行过程和最终结果。
在这里,我们展示的是已经打磨完成的数据集与我们支持的训练范式 ——它们不是为"跑分"而生,而是为真实使用场景而构建。 我们关注的不是让模型在基准测试上多拿 10%, 而是让模型在真实世界里少犯一次低级错误, 多理解一次隐含意图,多承担一份责任。
由软件、运维、安全等领域专家设计真实终端任务,并在沙箱中逐条验证,提供可执行、可复现、可评分的强化学习轨迹。
记录从需求、多轮修改到可运行网页与视觉证据的完整轨迹,覆盖主流网页场景,用于多模态 UI 生成与前端 Agent 训练。
专家原创构建多轮、跨工具与多跳推理任务,配套程序化验证环境,用于训练可靠的工具调用与 Agent 协作能力。
一线工程师、研究员在、白领专家真实生产工作中留下的 Agent 会话轨迹,完整保留请求上下文、思维链与工具执行结果,覆盖长程自主执行、多智能体协作与多模态交互形态。
由领域专家基于真实场景设计代码任务,并按照 Harbor 规范组织任务说明、运行环境、参考解与测试,形成可执行、可复现、可验证的数据,用于代码模型的训练与能力评测。
由行业专家复现真实职业工作流,构建可执行、可验证、直接对齐经济价值的Agent评测与训练任务;依托结构化Rubric建立机器可执行的逐条判定机制,并以SOTA模型多次作答实测任务区分度,最终达成评分可解释、奖励信号可信赖、训练梯度充足的三重交付保障。
把未公开的真实软件工程经验,转化为更少数据污染、更贴近真实研发环境的 Coding Agent 训练与评测资产。
行业专家围绕真实专业工作流构建可执行、可验证的 Agent 任务,覆盖专业软件操作与复杂成果交付,并通过参考产物、Rubric 与评估器核验执行过程和最终结果。