智象未来亮相 WAIC：多模态智能体，重塑创作的未来版图_推荐

智象未来亮相 WAIC：多模态智能体，重塑创作的未来版图

2025-07-29 13:34 智象未来

2025 世界人工智能大会（WAIC）期间，智象未来（HiDream.ai）联合创始人兼首席技术官姚霆发表主题演讲，系统阐释了多模态智能体在内容创作领域的技术突破与商业化实践。作为聚焦多模态生成的 AI 创新企业，智象未来期待通过探索多模态大模型的有效落地形式， “让创作回归灵感，让时间忠于故事” ，推动内容创作从工具效率提升向生产力革命跨越。

AI技术的爆发式发展，正从实验室快速走向产业应用。智象未来始终以“解决真实创作痛点”为导向，在商业化落地中探索出一条“技术筑基、场景破局、价值闭环”的路径。智象未来认为，真正的AI商业化不是单点技术的炫耀，而是从模型能力到服务形态，再到最终成果的全链路赋能。

智象未来持续致力于从技术到价值的产品化思路，在这一过程中，智象构建了“MaaS-SaaS-RaaS”的递进商业化体系

MaaS（Model as a Service） 是根基。打造百亿级多模态基础模型，支持图像、视频、音频、文本等多模态的生成与理解。

SaaS（Software as a Service）是桥梁。基于基础模型，开发面向垂直场景的产品，建设个人创作者平台和社区，将技术能力转化为开箱即用的服务，降低创作门槛。

RaaS（Result as a Service） 是终局。通过商业视频营销服务、新媒体创作智能体，直接为客户交付“可落地的成果”，让AI真正成为创作的“生产力工具”而非“技术概念”。

这种 “模型支撑服务，服务落地场景” 的逻辑，已在实际应用中验证：智象多模态生成平台已服务于影视制作、产品营销、文旅互娱等领域，实现从技术研发到商业价值的闭环。

多模态技术突破：从 “能生成” 到 “生成优”

技术实力是商业化的底气。智象多模态模型以“高维理解、精准生成”为核心，构建了覆盖图像、视频、编辑的全栈能力矩阵。

技术层面，智象多模态基础模型历经三次重要迭代，构建起 “理解深、控制准、画质高” 的核心优势。模型从 2023 年 8 月的 1.0 版本（扩散模型 DiT，实现多模态对齐），到 2024 年 6 月 2.0 版本（扩散自回归模型 DiT+AR，强化时空建模），再到 2024 年 12 月 3.0 版本（MoE 多场景学习，记忆增强），持续突破生成技术瓶颈。

这些能力转化为三大核心价值：语义一致性（如 IP 故事活化时保持风格统一）、精准可控性（支持个性化定制与元素自由调整）、影视级画质（4K 分辨率、长时序稳定输出），为专业创作提供技术保障。

在图像生成领域，HiDream 系列开源模型表现亮眼，累计下载量超 60 万次，被 Diffusers库、ComfyUI 、Recraft等主流工具集成。智象多模态全系列模型均在国际权威榜单排名前列。HiDream-I1 全面开源后24小时内即登顶 Artificial Analysis 榜单，成为首个问鼎榜首的中国自研模型，Hugging Face实时排名全球第一，下载量与点赞数持续攀升。此外，智象大模型家族已实现文本、图像、视频的联合建模，其视频生成产品支持4K高清画质、全局 / 局部可控及剧本多镜头生成，被行业专家评价为「重新定义 AIGC 的美学标准」。同时，结合其开源的交互式编辑模型HiDream-E1，用户通过自然语言指令即可完成图像生成及编辑，直接降低创作门槛，助力全球开发者与创作者实现“所想即所得”。

7月，继问鼎图像生成开源模型竞技场榜单后，最新开源模型HiDream E1.1再次强势跻身Artificial Analysis图像编辑智能体榜单第一梯队，作为领先的开源图像编辑模型，性能全面超越Flux.1 Kontext等主流模型，支持自然语言驱动的图像编辑 —— 用户通过文字指令即可完成背景替换、颜色修改、局部重绘等操作。

在视频生成领域，模型支持文生视频、图生视频、首尾帧生成，可精准复刻国漫、吉卜力等风格，实现镜头运动与画面运动的联合学习。通过扩散自回归模型（DiT+AR），我们解决了视频生成中“时空一致性”难题，让生成内容更贴近真实物理世界的规律。

在创作工具箱层面，AI口播、视频模板、运动笔刷、虚拟换衣、图像超分等功能，形成了“生成-编辑-优化”的完整闭环，满足从个人创作者到企业客户的全场景需求。

产品形态：agent驱动的“创作革命”，重构内容创作全流程

在产品形态上，智象以 “智能体” 为核心形态，构建覆盖图像生成、视频创作、营销传播的工具链。

作为面向短视频二创的智能体，vivago agent以“多模态输入、智能拆解、交互式生成”为核心优势。用户只需提供图像、视频、音频、文本等素材（例如咖啡馆的logo、照片、宣传语），即可自动分析需求、拆解任务（分镜设计、剧本生成、素材检索），调用图像/视频生成模型补全内容，并通过智能剪辑工具整合输出。它不仅能理解“棕色线条勾勒的火焰+波浪logo”的视觉特征，还能捕捉“静谧奢华的吧台场景”的氛围，让短视频创作从“从零开始”变为“按需生成”。

智象未来即将正式发布长视频编辑智能体-HiClip。针对长视频“内容过载、分发低效、回报周期长”的痛点，HiClip通过多模态语义理解，精准解构内容核心（如提取高光片段、生成音频摘要），实现“一次创作、全域适配”的二次传播。无论是影视片段的高光剪辑，还是教育课程的知识点拆解，HiClip都能让长视频内容焕发新的流量生命力。

产品化落地实现了创作方面的互补：vivago agent 聚焦短视频二创，通过模板检索、智能剪辑、多模态生成，帮助用户快速制作个性化内容，解决传统模板化创作的同质化问题；HiClip则针对长视频 “内容过载、分发低效” 的痛点，以多模态语义理解解构长视频核心信息，实现高光片段提取、跨平台适配剪辑，激发长视频二次传播价值。

生态共创：链接全产业链的价值网络

AI的价值，在于连接与赋能；技术与产品的落地，离不开生态的协同支撑。目前，智象未来正携手跨境、互联网、影视、新媒体、文旅等多领域伙伴，构建覆盖多领域的生态网络，形成 “技术-场景-生态” 的共赢格局。

让每个创作者都能更好释放创意潜力，是智象的始终坚持。让AI 真正 “理解创作、辅助创作”，让内容产业的生产力革新正加速到来。智象未来期待以多模态智能体为支点，与行业伙伴共同探索“技术为笔，创意为墨”的新可能——让每个创作者都能聚焦灵感，让每个故事都能抵达更远的地方。

［免责声明：此文内容为广告，相关素材由广告主提供，广告主对本广告内容的真实性负责。本网发布目的在于传递更多信息，并不代表本网赞同其观点和对其真实性负责，请自行核实相关内容。广告内容仅供读者参考。］