百亿参数图像模型Boogu正式开源,训练成本控制成亮点
近日,由华为香港人工智能实验室牵头,联合多所高校研究团队共同研发的Boogu-Image-0.1模型宣布开源。这一套图像生成与编辑模型体系参数规模达到100亿,包含了Base(基础)、Turbo(快速)、Edit(编辑)和Edit-Turbo(快速编辑)四个版本,全面支持中英文文本提示词输入。
高效训练:40万美元与2亿张图的“性价比”之路
最引人注目的是其宣称的训练效率。模型团队披露,基础版本完全从零开始训练,所使用的经过严格去重的图像数据约为2.0862亿张。根据论文估算,完成这次训练的理论成本仅在40万美元左右。这一数字在动辄需要数百万乃至上千万美元计算资源的AI大模型领域,显得颇为克制。
性能表现:跻身开源第一梯队,部分能力比肩闭源模型
根据公开的评测报告,Boogu在多项标准图像生成测试中,综合表现已经进入了开源模型的第一阵营。研究团队指出,其生成结果在部分任务和指标上,与当前业界领先的闭源模型成果相差无几,展现出强大的竞争力。
技术特性:智能提示词处理与自适应模型调度
该模型系统设计上融入了一些实用化的智能特性。在实际生成前,系统会先对用户输入的提示词进行理解和语义改写,旨在提升指令的明确性和模型的理解精度。更重要的是,系统能够根据用户请求的任务复杂程度,自动在Base、Turbo等不同版本间进行调度选择。这种设计旨在避免对简单任务使用重型模型,从而有效降低不必要的推理计算成本。
规格与开源详情
- 分辨率支持:Base和Edit模型最高支持生成2K分辨率的高清图像;Turbo系列则专注于效率,仅需3到4步推理即可快速产出1K分辨率的图片。
- 开源协议:项目已按照Apache 2.0开源协议,公开发布了完整的模型权重、推理代码以及部分核心训练方法细节,方便社区研究、使用与二次开发。
Boogu的开源,为AI图像生成领域提供了一个新的、高性价比的技术选项,其独特的成本控制方案和智能化工作流设计,可能会对开源社区的后续发展产生影响。