微软于北京时间 7 月 24 日宣布推出新一代自研图像生成模型 MAI-Image-2.5-Pro,这是微软 AI 团队在图像生成领域的最新突破。该模型目前已进入公开预览阶段,并已在 Bing、PowerPoint 和 OneDrive 等多个微软产品中投入应用。
自研技术路线,打造企业级图像生成能力
作为微软 MAI 系列模型的重要成员,MAI-Image-2.5-Pro 代表了微软在自主研发 AI 模型方面的坚定承诺。与业界通常采用第三方模型蒸馏的做法不同,微软采用了完全自主的技术路线,使用经过清理、可追踪的企业级数据进行训练,确保了模型的透明性和可控性。这一策略不仅提升了模型的质量,也为企业用户提供了更加安心的使用环境。
精度创新高,文字生成能力突出
MAI-Image-2.5-Pro 在精度方面实现了重大提升,成为微软目前精度最高的图像生成模型。该模型在图像中文字生成准确性方面进行了专项优化,这对于需要精准文字渲染的商业设计场景尤为重要。模型支持自然语言编辑指令,用户可以通过简单的文字描述来调整生成内容,大幅降低了设计师的工作负担。
在功能层面,MAI-Image-2.5-Pro 支持主视觉图片生成、细节编辑以及图像内文字渲染等多种应用场景。无论是创意设计还是产品营销,该模型都能提供高质量、设计就绪的图像输出。
广泛落地,产品体验显著提升
MAI-Image-2.5 系列模型已经在微软的主要产品中得到应用,并带来了实实在在的性能提升。
在 Bing Image Creator 中,MAI-Image-2.5 已成为默认的图像生成模型,为全球用户提供高质量的图像生成和编辑能力。
在 PowerPoint 中,该模型被用于图像到图像的编辑功能。微软数据显示,与前代模型 GPT-Image-2 相比,MAI-Image-2.5 可降低最高 84% 的 GPU 成本,这意味着微软在保证用户体验的同时,大幅降低了服务成本。
在 OneDrive 中,MAI-Image-2.5 已成为部分图像编辑功能的默认模型。部署后的数据表现令人印象深刻:相关场景的保存成功率提升了 26%,P95 延迟降低了约 25%,在中等负载生产环境中的效率提升了 2.5 倍。这些数字充分说明了新模型在实际应用中的优势。
灵活的定价策略,满足不同需求
MAI-Image-2.5-Pro 的公开预览定价为:文本输入每 100 万个 Token 收费 5 美元,图像输入每 100 万个 Token 收费 8 美元,图像输出每 100 万个 Token 收费 106 美元。微软还推出了性能更均衡的 MAI-Image-2-Flash 版本,速度提升 22%,价格下降 41%,为追求性价比的用户提供了更多选择。

模型矩阵持续扩展,生态建设加速
除了图像生成模型,微软还发布了 MAI-Voice-2-Flash 语音模型,该模型相比前代速度提升 2 倍,成本降低 32%,已在 Dynamics 365 Contact Center 等场景中应用,为企业客服提供了更高效的语音交互能力。
微软表示,MAI 系列模型将继续扩展,并通过 Foundry 平台向开发者开放。同时,微软 AI 团队的下一代 GB200 计算集群已投入运行,为后续更强大的模型研发提供了充足的计算资源支撑。
微软在自研 AI 模型方面的投入和成果,不仅展现了其技术实力,更体现了其对用户体验和企业级应用的深刻理解。随着 MAI-Image-2.5 的推出和应用,微软正在构建一个更加完整、高效的 AI 生态,为用户和开发者创造更多价值。