download BusinessFocus app
原生全模態路線進階,智象未來發佈交互式世界模型HiDream-O1-World

原生全模態路線進階,智象未來發佈交互式世界模型HiDream-O1-World

Market Information Media OutReach
By Media OutReach on 24 Aug 2026
Media OutReach is the first full-service newswire company in Asia Pacific offering a totally integrated service of press release distribution and media monitoring with analysis service for the public relations and investors relations communities. Founded in 2009, the company is headquartered in Hong Kong with office in Singapore.

北京,中國 - Media OutReach Newswire - 2026年8月24日 - 今日,智象未來(HiDream.ai)正式發佈HiDream-O1-World,一款原生全模態交互式世界模型。


原生全模態路線進階,智象未來發佈交互式世界模型HiDream-O1-World


HiDream-O1-World具備漫遊、編輯、交互三大功能,支援文字、圖像、交互等多模態輸入。用戶可一鍵生成時空一致、符合物理規律、可長時推演的完整世界。

模型搭載智象自研的原生全模態UiT(Unified Transformer)架構。升級後的UiT在交互式世界模型領域兩大核心挑戰——時空一致性與物理一致性上取得關鍵突破:鏡頭推拉搖移時,場景幾何結構保持穩定,物件不會消失或變形;碰撞、遮擋、重力響應高度符合真實世界的因果邏輯,而非隨機拼接的畫面。

智象未來CTO姚霆表示:「交互式世界模型的價值,不在於生成一個逼真的三維場景,而在於AI開始真正理解空間的深度、物件的質感、運動的慣性與光影的邏輯。這是對物理世界運行規律的系統性認知與重塑。HiDream-O1-World正是這場重塑的第一道橋樑——讓每一次交互,都通往一個從未抵達的世界。」

首次參評即登頂,刷新交互式世界模型上限

HiDream-O1-World近日在第三方評測WBench中交出首份成績。WBench由美團LongCat團隊與復旦大學聯合推出,是業內首個面向交互式世界模型的系統性評測基準,涵蓋289個多輪交互案例、1,058個交互輪次,基於五大維度、22項指標構建。

智象HiDream-O1-World在核心的Navi分榜以平均分80.9登頂,物理(Physical)維度73.3分位列第一,一致性(Consistency)維度達88.0分,綜合表現排名榜首,超越騰訊混元1.5、阿里快樂生蠔等主流模型。Navi分榜聚焦空間導航與視角控制,被業界視為衡量世界模型空間理解能力的核心標尺。首次參評即登頂,刷新交互式世界模型性能上限。

一鍵生成世界,開啟沉浸式交互體驗

模型支援文字、圖像、交互式操控等多模態輸入,用戶只需一段描述、一張圖片或簡單操控,即可一鍵生成結構完整、風格多元的交互世界。例如上傳一張室內照片,模型便能快速構建高精度數碼孿生空間,自動補全整間臥室全景圖——比例精準、細節豐富。

模型提供第一人稱與第三人稱兩種漫遊視角。以潛水場景為例,視角移動時水面光影與海底碎光同步變幻,珊瑚礁色彩分明、魚群游弋自如,拉近後珊瑚紋理清晰可見,全程穩定無漂移。

不止漫遊,模型還支援實時編輯——驅動角色完成抓取、奔跑、下蹲、跳躍等動作,或觸發降雨、物件墜落等環境事件。所有變動基於幾何、光照、材質到物理邏輯的全局統一,確保每次交互都自洽。

模型具備強大泛化能力,支援人類、動物、虛構角色等,精準適配各角色形態與運動。以登雪山場景為例:腳印在雪面壓出真實凹陷,雪花隨風飄落緩急有致,遠處群山輪廓與腳下岩石紋理隨視角推移自然銜接。場景風格涵蓋真實城市街景、自然地貌、室內空間,以及幻想異世界、二次元卡通、3A遊戲級渲染。

兩大核心突破:長時程時空一致性與物理一致性

交互式世界模型長期受制於空間、物理與記憶三大難題:視角切換引發畫面漂移與結構紊亂;物理違和(穿牆、懸浮)折損可信度;缺乏長效記憶導致物件消失。HiDream-O1-World透過UiT架構實現關鍵突破,核心在於兩大協同能力:

長時程時空一致性。模型將「3D先驗注入Memory上下文」與「Test-Time Training(TTT)在線維護」協同設計。Memory機制將場景幾何結構與物件空間關係編碼為3D先驗,讓模型在多輪視角切換中「記住」已探索結構,從根本規避漂移與場景「重置」。TTT在推理階段進行輕量級在線自適應,動態優化適配器,使內部表徵與場景3D約束持續對齊。傳統模型如同「畫師逐幀作畫」,微小偏差不斷放大;HiDream-O1-World則如一位擁有「空間記憶」的導演,在Memory中記錄結構,鏡頭移動時調取對應視角,而非每步重新揣測環境。

全局穩態物理一致性。訓練端,生成式世界模擬器產出涵蓋剛體碰撞、流體運動、柔性形變、重力拋射等的合成數據,強化模型歸納偏置;推理端,同一TTT機制在線增強物理一致性,當新物件或材料出現時動態調整表徵。雙輪驅動設計帶來實質突破——視覺合理性評測較行業平均提升13.6%,因果保真度評測提升12.7%。

這一技術路線獲國際頂會認可。相關論文入選ECCV 2026(歐洲計算機視覺國際會議,全球計算機視覺與AI領域三大頂級學術會議之一)。

論文:DreamWorld: Geometry-Grounded Video Diffusion for 3D-Consistent World Modeling
項目主頁:https://yanghb22-fdu.github.io/DreamWorld

三大產業新格局

AI互動影遊。用戶不再被動跟隨線性劇情,而是敘事的主動參與者,世界隨探索沿不同分支劇情演進,在影視級視覺質感中獲得前所未有的沉浸感,享受多重結局。

具身智能仿真。模型可高效搭建遵循物理規則的城市、工廠、室內等仿真空間,為機器人訓練、自動駕駛、智能製造提供虛擬試驗底座,替代高成本、高風險的實景測試。

3D場景生產。面向創作者與設計師,模型可生成3D手辦、家居場景及藝術空間,支援結構微調與風格切換。更具想像空間的是向微觀世界延伸——精準模擬細胞行為、蛋白質相互作用,為藥物發現與疾病機理研究開闢數碼仿真新路徑。

當物理世界可被一鍵生成、自由交互,許多行業都值得被重新想像。這些領域還只是冰山一角——隨著開發者與創作者不斷加入,交互式世界模型的應用邊界將遠超今天所能描繪的範圍。

Hashtag: #HiDreamAI #智象未來

發佈者對本公告的內容承擔全部責任

【了解更多最快最新的財經、商業及創科資訊】

👉🏻 追蹤 WhatsApp 頻道 BusinessFocus

👉🏻 下載 BusinessFocus APP

👉🏻 立即Follow Instagram businessfocus.io

最新 金融投資熱話專頁 MarketFocus