FlowPod AI
首页
训练Krea 2:生成模型训练中的关键要素——Sangwu Lee,Krea.ai
AI Engineer
AI Engineer/未知时间

训练Krea 2:生成模型训练中的关键要素——Sangwu Lee,Krea.ai

生成模型数据清洗Krea 2AI训练开源模型创意AI
中文导读

Krea.ai联合创始人Sangwu Lee在AI Engineer播客中分享了训练生成模型Krea 2的实战经验。他强调数据在架构锁定后的决定性作用,并揭示了数据清洗、去重、标注中的具体陷阱,如画作照片训练导致模型总生成画框。Krea 2追求快速生成与风格多样性,其中型版本已开源,为创意探索提供新工具。

核心观点
1.数据是生成模型训练的核心,架构确定后数据质量决定上限。(约 0:00)
2.训练数据需严格清洗:拒绝AI生成图像,避免风格污染;去重需结合哈希与嵌入。(约 5:00)
3.标注质量影响模型行为,如画作照片未标注画框导致模型生成画框。(约 10:00)
4.Krea 2优化快速生成与风格范围,适合创意探索阶段。(约 15:00)
中文精读

在AI Engineer的这期播客中,Krea.ai的Sangwu Lee分享了训练生成模型Krea 2的宝贵经验。他直言,在架构锁定之后,数据就是一切。这一观点对于中文AI从业者尤为重要,因为国内大模型竞赛中,数据质量常被忽视,而Lee的实战细节提供了可操作的参考。

Lee指出,一个常见的训练数据陷阱是:使用画作照片作为训练数据时,标注者常忽略画框和背景白墙,导致模型学会在生成的每幅画外加画框。这提醒我们,数据标注的细致程度直接影响模型输出,中文社区在构建数据集时需警惕类似偏差。

他明确拒绝使用AI生成图像训练,因为AI美学具有粘性,会继承他人模型的风格。这一立场对中文创作者有警示意义:依赖AI生成数据可能让模型失去原创性,尤其在内容创作领域,保持数据纯净至关重要。

去重方面,Lee采用两阶段策略:先对20-100亿图像做哈希去重,再用嵌入处理近似重复。这种高效方法对中文互联网海量数据同样适用,可提升训练效率。此外,他提到用大型视觉语言模型的判断蒸馏出轻量分类器,以低成本筛选海量数据,这为资源有限的中文团队提供了新思路。

Krea 2的中型版本已开源,其设计目标是快速生成和风格多样性,适合尚未明确需求的创意工作室。对中文AI社区而言,开源模型提供了探索生成边界的机会,尤其在设计、艺术等需要风格创新的领域。

总之,这期播客不仅分享了技术细节,更强调了数据伦理和创意价值,值得中文AI从业者深思。

下一集
AI工作流让你跻身顶尖1% | 实用升级步骤