我们的数据生产方式/HOW WE BUILD DATA
AI Native Data Pipeline
AI 驱动构建,灵活组合的数据生产流水线
从标准化需求出发,由 AI 编码搭建产线,组合可复用的人审、机审与合成节点,让 AI 贯穿数据生产与产线管理。
从标准化需求,
到基础产线。
将项目要求整理为需求规范,结合界面组件库、原子策略节点与产线模板,由 AI 构建基础产线。复用已有积累,让界面与流程随任务需求快速调整。
复用成熟策略,
灵活组合人机流程。
已有的原子策略节点可以直接选用、组合。把成熟能力带入新项目,让产线搭建更快,也让人审、机审与合成按任务需要协作。
丰富的策略节点,直接复用。
复用已积累的机审与合成策略,结合任务需要安排人审,让不同节点共同支撑产线搭建。
可复用策略,持续积累。
文件类
部分策略示例围绕文件的重复、相似、真实性与合规要求,选用对应校验。
重复性校验
检查文件是否重复提交或重复收录。
相似度校验
识别内容相近的文件。
AI 含量校验
检测文件内容中的 AI 生成特征。
数据真实性校验
检查数据内容的真实性。
文件合规性校验
按项目规则检查文件是否符合要求。
更多策略节点
持续积累,按项目需求选用。
文本 / Query 类
部分策略示例从生成特征、内容差异到任务质量,检查文本与 Query。
AI 含量检测
识别文本中的 AI 生成特征。
相似度检测
识别与已有文本或 Query 相近的内容。
模板化检测
检查固定句式、结构套用与模板化表达。
合理性检测
检查任务设定、约束与要求是否合理。
难易度检测
评估任务复杂程度是否符合项目要求。
更多策略节点
持续积累,按项目需求选用。
Repo 类
部分策略示例围绕技术栈、代码深度、演进历史与仓库差异,检查 Repo。
技术栈检测
检查语言、框架与技术栈是否符合任务要求。
Repo 深度检测
检查代码与模块是否具备任务所需的复杂度。
Repo 历史检测
查看提交数量与演进轨迹,识别短历史、集中生成等需复核的线索。
Repo 相似度检测
检查与已有仓库的代码和结构相似性。
任务可定位性检测
检查 Query 涉及的模块、接口与文件是否存在于仓库中。
更多策略节点
持续积累,按项目需求选用。
Rubric 类
部分策略示例围绕规范、要求覆盖与判断依据,检查评分标准。
Rubric 基础规范检测
检查评分项的格式与必要信息是否完整。
Rubric 覆盖度检测
检查 Query 中提出的要求是否都有对应评分项。
Rubric 客观性检查
检查判定条件是否明确,减少主观判断空间。
评分项原子性检查
检查单项是否混合多个应独立判断的要求。
评分项重复与冲突检查
识别重复计分、条件重叠或相互矛盾的评分项。
判定证据可验证性检查
检查评分项能否通过输出、文件、运行结果等证据验证。
更多策略节点
持续积累,按项目需求选用。
人审协作方式
部分方式示例围绕合成内容、机审结论和多人判断,安排专家参与。
合成结果 Review
由专家检查、修订模型生成的内容,确认是否符合任务要求。
机审结果复核
查看机审依据,对误判、争议或边界情况作进一步判断。
Majority Vote · 多人投票
多人独立判断后汇总意见;平票或明显分歧需进一步处理。
质量抽检
抽查已放行数据,发现机审遗漏与误判,验证整体数据质量。
数据合成节点
部分节点示例由模型生成初稿或补充信息,减少专家从零编写的工作。
Rubric 合成
根据任务要求生成评分表草稿,由专家补充、修订和确认。
关键步骤合成
生成任务完成的关键步骤,供专家校核与完善。
题目元信息合成
生成题目描述所需的元信息,供后续检查与使用。
测试用例合成
补充常规与边界用例,再通过执行或人工检查验证。
对照样本合成
生成可控差异的正反例,供质量评估与专家校核。
更多合成场景
按项目需求组合。
同一套节点,多种组合方式。
机审、合成与人审,按项目需要组合。让每份数据沿着适合它的流程,完成加工与审核。
Buzzer项目
Pale项目
Coconut项目
每行展示一份数据的流转,节点组合为示意。
··· 更多组合让 AI 直接操作产线。
将产线搭建与管理方法沉淀为 Skills,通过 MCP 连接执行工具,让 AI 完成产线创建、项目部署、策略扩展、告警调整、故障排查与节点重执行。
研发与运营无需在庞大的标注后台中逐项配置,通过 AI 管理产线;专家继续使用专用生产界面。
❯ /anno-autoline 按这份需求帮我搭一条产线,包含机审、合成和人审。
# input: 需求规范从需求到可运行的产线
构建结果生成基础产线与面向专家的生产界面。
❯ /anno-autoline 帮我部署这个项目的最新版本,并检查产线能否正常访问和运行。将项目部署到运行环境
部署结果从版本部署到运行检查,通过同一条 Query 完成。
项目独立调整各数据项目的代码、发布与数据互不影响,支持生产流程独立迭代。
❯ /anno-autoline 在最终人审前,加一个 Rubric 覆盖度检测节点。将新策略接入现有流程
流程变化复用已有策略,把新的检查要求加入生产流程。
❯ /anno-autoline 把告警改成连续失败或超时触发,通知发到项目告警群。更新告警触发规则
配置变化按项目需要调整监控与告警策略。
❯ /anno-autoline 这条数据的策略执行失败了,帮我查一下原因。定位到具体的失败环节
排查结果沿执行记录排查,将问题定位到具体节点与输入。
❯ /anno-autoline 重新跑一下这条数据的 Rubric 覆盖度检测节点。为指定节点发起一次新执行
执行记录上次执行
保留原执行记录
本次执行
重新触发指定节点
重新触发后,通过执行记录跟踪本次运行状态。
机审策略,
也需要被检验。
从规则与算法,到 LLM 与 Agent 判断,我们通过对应的评估集检验机审策略,关注判断准确性与误杀情况。
不同的判断方式,
都有对应的评估集。
按规则与算法检测
如重复性校验、基于向量检索的相似度检测。
LLM as Judge
由模型依据审核标准,对内容作出判断。
Agent as Judge
结合工具调用与多步核验,作出判断。
按检查任务选用判断方式,评估其实际效果。
用评估样本,对照策略判定。
评估方式示意- 评估样本
- 策略执行
- 判定对照
- 查看结果
| 样本 | 预期判定 | 策略判定 | 对照结果 |
|---|---|---|---|
| 01 | 通过 | 通过 | 一致 |
| 02 | 不通过 | 不通过 | 一致 |
| 03 | 通过 | 不通过 | 误杀 |
| 04 | 不通过 | 通过 | 漏检 |
策略判定是否符合预期?
合格样本是否被错误拦截?
仅示意判定关系,不代表实际评估结果。