人工数据合成
当真实标注数据不足、难以获取或存在隐私限制时,通过自动化手段生成带标签的训练数据。
常见策略
| 方法 | 原理 | 典型工具/场景 |
|---|---|---|
| 程序化生成 | 规则驱动批量生成 | 生成带噪声的印刷体文本图像、3D 渲染场景 |
| 本真数据扰动 | 对已有数据做变换扩增 | 图像旋转/裁剪/颜色扰动、语音加噪 |
| GAN/扩散生成 | 生成模型产生逼真合成样本 | 人脸生成、医学图像合成 |
| LLM 生成 | 大模型生成文本标注数据 | 文本分类、QA 对生成、指令数据 |
核心要点
- 覆盖度:合成数据需覆盖真实分布中的变化因素(角度、光照、噪声等)
- 域迁移:合成数据跟真实数据往往存在分布差异(sim-to-real gap),需用域适应或混合训练
- 质量优先:少量高质量合成数据远优于大量低质量噪声
- 一致性:合成数据可精确控制标签,降低标注成本
应用
自动驾驶(合成场景)、文档 OCR(合成印刷体)、NLP 分类(LLM 生成)、医疗影像(GAN 生成病变区域)。