7月31日,MiniMax宣布正式发布新一代多模态生成模型MiniMax H3。
H3是一款通用全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文进行统一理解,能够输出具备原生双声道的音视频内容,最高可支持15秒2K分辨率。
据MiniMax介绍,H3不再以单一任务为边界,而是面向多模态上下文统一理解创作意图,完成更自然连贯的生成与表达。
在模型效果方面,H3具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、视频到视频动作迁移等方面表现突出,可实现精准可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。
MiniMax表示,计划在未来几天内,在符合相关法律法规的前提下,开放模型权重。
H3是MiniMax推出的首款开源多模态生成模型,借鉴了文本模型发展过程中已被验证的方法,包括复杂问题拆解、推理、上下文扩展和Muon优化器等,并将其应用到多模态理解、数据构建和模型训练中。
与目前市面上主流的视频生成模型相比,H3在多个维度上呈现出不同的产品定位。
多数竞品如OpenAI Sora、Google Veo和快手可灵等均采用闭源商业模式,仅提供API调用或订阅服务,而H3选择开源权重,允许开发者和企业本地部署和二次开发,这在当前多模态生成领域较为少见。
在模态能力上,许多模型专注于文本到视频的生成,对多模态输入的融合理解较弱,H3则强调对文本、图像、视频和声音的统一上下文理解,并支持带原生双声道的音视频输出,这在广告叙事、产品演示等需要声画协同的场景中更具实用性。
此外,H3在可控性方面强调视频到视频的动作迁移和精准编辑,而部分竞品更侧重从零生成,对已有视频的修改能力有限。
在技术路线上,H3将文本大模型中的推理和优化方法迁移到多模态训练中,这一做法与多数依赖扩散架构的竞品有所区别。
在成本方面,H3视频生成定价为0.8元/秒(2K分辨率),约为业内同类旗舰视频模型的三分之一,同时MiniMax通过高压缩Tokenizer和系统级优化进一步控制推理成本。
这一价格策略结合开源模式,可能降低中小企业和开发者的使用门槛。
此前在2026世界人工智能大会期间,H3已在MiniMax展台进行预热展示。7月31日当天,智谱也宣布面向开发者群体的付费订阅服务GLM Coding Plan开放订阅



