遵循“数据飞轮”逻辑:场景牵引数据、数据驱动模型、模型赋能应用、应用反馈迭代。完整流程七步:需求定义(明确数据集服务的 AI 场景与质量要求)→数据采集→数据治理(清洗、去重、脱敏、标准化)→数据标注(人机协同,为大模型辅助预标注加人工复核几乎是唯一可行的规模化路径)→质量评测→发布应用→根据模型训练效果迭代优化。数据清洗工程量常被低估:行业实践显示原始数据经清洗后保留率可能只有一成左右,即产出 100GB 高质量语料约需准备 1TB 原始素材;人工精标中文语料每人每天约 3—8 万字,大规模精标的人力成本极高。数据工程通常占平台建设总投入的一半以上,是真正的胜负手。
收起>