博客&研究
- 一周交付上万条专家数据的标注系统是怎么设计的?交付周期紧、需求变化快、质量反馈慢。我们将 AI 融入产线设计、数据生产和质检全过程,用标准化工具承接重复操作,形成人机协同的规模化标注系统。博客阅读全文
- 现在的 Rubrics 配评价模型吗?自然语言 Rubric 正在获得超过其质量的权力。自动生成的标准会奖励好好先生式的完整答案,而真正的专业判断需要锚点、分级和可解释的权重。博客阅读全文
- 超越Benchmark:面向中国场景的Coding 专家交互式评估(下)下篇介绍贯穿全流程的多关质检、126 题四维模型的多维评测画像,以及 Expert Evals as a Service 的标准配置与可选套件。博客阅读全文
- 超越Benchmark:面向中国场景的Coding 专家交互式评估(上)公开 benchmark 分数趋同,却难反映真实工程能力。上篇介绍 benchmark 的三重局限、专家在环的交互式评估方法,以及公平、专家、标准三大支柱。博客阅读全文
- 「智能知识」完成天使轮融资,锦秋基金、耀途资本联合投资,加速建设中国大模型高质量数据基础设施智能知识(Human Intelligence)宣布完成天使轮融资,由锦秋基金、耀途资本联合投资。本轮资金将用于前沿数据品类扩张与专家网络升级,帮助中国模型持续进步,参与SOTA竞争。博客阅读全文
- 数据合成有没有未来?我们发现事实结论人工标注不仅依然必要,而且要求更高了。我们对SETA和Terminal-Bench Pro两个数据集做抽样审查,发现近九成题目存在严重质量问题。纯靠AI合成不行,找不对人来把关也不行。博客阅读全文
- SETA-Terminal bench合成数据质量分析本文基于对 SETA 数据集中12个Terminal Bench任务审查,梳理出高频质量问题:指令与测试不对齐、环境构造失真、验证粒度不足、题目信息泄露过度等。对于RLVR训练范式,这类缺陷会直接污染 Reward 信号。博客阅读全文
- Rubric第四讲:如何用Rubric把控数据质量质量和速度一定是矛盾的吗?本文介绍一面千识研究院的"可信规模化"实践,通过评分量表体系构建从需求定义、共同设计、验证校准到规模化生产的四阶段质量闭环。博客阅读全文
- Rubric第三讲:如何科学的设计和优化rubric评分量表不仅仅是规定,更是一种可迭代的预测模型。本讲从结构化设计、质量衡量(如评分者一致率)和质量提升三个维度,深入解析了Rubric背后的科学原理。博客阅读全文
- Rubric第二讲:深入了解不同类型的rubric及其使用场景设计评分量表时,需要从颗粒度与特异性两个维度做决策,并决定评估应关注模型生成答案的过程还是结果。本文解答了衡量什么、在哪里衡量以及如何衡量三个核心问题。博客阅读全文
- Rubric第一讲:评分量表(Rubrics)如何帮助提升大模型可靠性结构化评分量表为生成式AI提供可操作、可复用的评估框架,帮助从直觉式评估过渡到系统化、多维度的质量衡量,显著提升可靠性与一致性。博客阅读全文
- 低代码:数据标注界面的终极解决方案在AI快速发展的时代,数据标注任务日益复杂多样,从LLM Arena的对抗性评估到Agent的复杂交互流程标注,传统固化的标注模板已难以满足高频定制化需求。博客阅读全文
- Majority Vote介绍与一致性算法多数投票(Majority Vote)是一种广泛应用于数据标注的标签聚合方法。研究阅读全文
- 从原始数据到高质量标注:标注系统背后的流水线是如何运作的?随着大模型对高质量数据需求的激增,传统的"人海战术"标注方式已无法满足现代AI训练需求。本文深入剖析如何构建现代化数据标注系统的工作流程。博客阅读全文
- RLVR: 可验证奖励的强化学习可验证奖励的强化学习(RLVR)是向大型语言模型注入学习信号的主要训练策略之一。研究阅读全文
- 有了顶尖专家,为什么还无法产出好数据?大模型竞赛进入下半场,模型公司之间在算法和算力的投入的边际效益快速收窄,真正能拉开模型能力差距的是未曾载于书籍与互联网,但存在于各行各业专家经验之中的"专家数据"。博客阅读全文
- HITL:用户反馈与专家知识的分工与价值在智能体(Agent)应用中,HITL(Human-in-the-Loop)打开了人类智慧介入 Agent 运转系统的大门。研究阅读全文
- 我们为什么做Xpert Studio我们正处在一个由AI驱动的巨大变革时代,AI的价值正从"在实验室解决难题、刷新排行榜" 转向"在实际经济活动中发挥真正价值"。博客阅读全文
