8月17日消息,智象未来(HiDream.ai)今日正式发布原生全模态交互式世界模型HiDream-O1-World。该模型支持文本、图像及交互式操控等多模态输入,并提供漫游、编辑、交互三类能力,可生成具备较强时空一致性和物理一致性的可交互场景。

据介绍,HiDream-O1-World基于智象未来自研原生全模态UiT架构。此次升级重点解决交互式世界模型中的长时程空间一致性和物理一致性问题。模型通过将3D先验注入Memory上下文,并结合Test-Time Training(TTT)机制,在推理过程中持续维护场景几何结构和空间关系,以减少镜头移动过程中出现的物体漂移、形变或消失等问题。

在物理一致性方面,智象未来表示其在训练阶段引入大量物理模拟数据,覆盖刚体碰撞、流体运动、柔性形变、重力抛射及光影变化等场景,同时强化跨帧时序因果建模;推理阶段则借助TTT机制,根据当前场景进行在线自适应,以提升不同物体和材料条件下的物理合理性。

第三方评测方面,由美团LongCat团队与复旦大学推出的交互式视频世界模型评测基准WBench中,HiDream-O1-World在Navi分榜取得80.9分,其中Physical指标为73.3分,Consistency指标为88.0分,并位列该分榜第一。

功能层面,HiDream-O1-World支持第一人称和第三人称视角漫游,用户可控制角色行走、调整视角,也可以驱动角色完成抓取、奔跑、下蹲、跳跃等动作,或触发降雨、物体坠落等环境变化。模型同时支持人类、动物及虚构角色,并覆盖真实街景、自然地貌、室内空间以及二次元、游戏渲染等多种场景和风格。

智象未来CTO姚霆表示,交互式世界模型的核心价值并非单纯生成逼真的三维场景,而是让AI进一步理解空间深度、物体质感、运动惯性及光影逻辑。HiDream-O1-World的发布,也意味着智象未来将继续沿原生全模态架构路线推进世界模型研发。

在应用方向上,智象未来将HiDream-O1-World瞄准AI互动影游、具身智能仿真以及3D场景生产等领域。其中,在具身智能场景中,公司希望利用世界模型构建城市、工厂和室内等虚拟环境,为机器人、自动驾驶及智能制造提供仿真训练环境。

此外,值得一提的是其围绕空间一致性的研究论文《DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling》已入选ECCV 2026。(袁宁)