download BusinessFocus app
原生全模態技術戰略閉環,智象(HiDream.ai)發布具身世界模型 HiDream-O1-Embodied

原生全模態技術戰略閉環,智象(HiDream.ai)發布具身世界模型 HiDream-O1-Embodied

Market Information Media OutReach
By Media OutReach on 08 Sep 2026
Media OutReach is the first full-service newswire company in Asia Pacific offering a totally integrated service of press release distribution and media monitoring with analysis service for the public relations and investors relations communities. Founded in 2009, the company is headquartered in Hong Kong with office in Singapore.

北京,中國 – Media OutReach Newswire – 2026年9月8日 - 智象未來(HiDream.ai)正式發布具身世界模型 HiDream-O1-Embodied。秉承原生全模態的技術理念,模型進一步強化機器人的物理感知及動態預判能力,助力具身智能實現更高階的物理互動。具身模型的發布,標誌着智象逐步打通圖像、視頻、3D、動作等模態,貫通「理解—推演—執行」全流程,構建統一世界模型基座的技術閉環。


Picture.png


模型發布同期,HiDream-O1-Embodied 首次參評具身智能模型評測平台 RoboColiseum,並即時在核心的 Robustness(擾動適應)子榜單中,以平均分 0.692 的成績登頂榜首。

智象未來 CTO 姚霆表示:「我們相信,圍繞真實世界的表達、理解和生成,構建同時具備全模態表達、因果推演與物理世界構建三大核心能力,才能建立完整的世界模型基座。智象的原生全模態世界模型技術理念,從設計架構之初便計劃面向包括動作等在內的統一表徵構建。HiDream-O1-Embodied 的發布,是這一技術戰略從『模擬世界』邁向『真實世界』的關鍵里程碑。」

登頂 RoboColiseum:以 0.692 分的「擾動適應」交出硬核答卷

常態化具身智能仿真評測平台 RoboColiseum 旨在構建多維度的系統評測體系,通過與真機表現高度一致的仿真評測,幫助開發者識別模型的能力優勢與短板,持續迭代提升。平台面向全球高校、科研機構、模型企業與研究者開放,實時更新評測結果,致力於構建一套結果可信、過程可復現的具身模型評測標準。

該平台基於高保真仿真環境構建,高度還原真實世界。平台圍繞四個維度推出 4 類能力子榜、78 個高保真仿真評測任務——指令跟隨、空間理解、擾動適應與通用操作。自內測上線以來,已吸引海內外數十款重量級模型參與評測。

在這四個維度中,擾動適應(Robustness)被公認為最具挑戰性的一環。它通過改變背景、光照、材質、機器人初始狀態、相機位置與圖像質量,並對指令進行多樣化改寫,檢驗模型在非理想環境中的穩定性與泛化能力。換言之,這不是在實驗室的「溫室」裡考試,而是在各種「意外」中檢驗真正實力。

HiDream-O1-Embodied 以 0.692 分的成績登頂該榜單,這得益於其原生全模態底座。原生全模態世界模型天然為跨模態理解與生成提供基礎。而在執行環節,為了確保在真實世界的各類「意外」中保持穩定,HiDream-O1-Embodied 在三項核心能力上進行突破性創新,讓理解更精準、感知更穩健、抗干擾能力更強。

語言理解——突破關鍵詞匹配的局限

傳統機械人對語言指令的理解往往停留在關鍵詞匹配層面。說「把杯子拿過來」能聽懂,換成「給我拿個杯子」或「杯子遞我一下」就可能「宕機」。HiDream-O1-Embodied 覆蓋多元動詞、句式與表達方式的等價指令空間,不受句式限制,只鎖定意圖本身。無論指令如何變換,它都能穿透字面,直達用戶的真正意圖。

視覺感知——多視角協同,避免「一處失靈、全局失效」

在物理世界中,機器人的視覺通道並非處於理想狀態。相機位置可能發生偏移,標定精度會隨時間變化,單一路畫面亦可能受到遮擋或干擾。HiDream-O1-Embodied 綜合多個視角的訊息,讓不同視覺通道相互補充,而非依賴某一固定視角。當部分視覺資訊出現偏差或暫時不可用時,模型仍能借助其他視角理解場景、判斷任務並繼續執行,讓系統由「一處失靈、全局失效」,轉變為「局部受限、整體仍可運行」。

高容錯機制——在「不完美」中學會穩定執行

大多數模型的訓練基於「完美數據」——清晰的圖像、完整的畫面、標準的視角。但真實世界從來不是這樣。光照變化、畫面污損、視野遮擋、訊號波動,都是機械人在實際運行時可能遇到的日常情況。

HiDream-O1-Embodied 在訓練階段便主動引入多種非理想條件,讓模型反覆面對不完整、不穩定的資訊,並學會從有限線索中作出可靠判斷。這樣的訓練使模型不只追求理想條件下的最佳表現,也更加重視複雜環境中的持續穩定。

這種容錯能力亦不局限於某一種視覺異常。面對光照、外觀和場景變化,模型能夠更靈活地利用已有資訊,減少環境變化對任務執行的影響。對 HiDream-O1-Embodied 而言,真正重要的不只是「看得清時做得好」,更是「條件不理想時,依然能夠穩穩完成任務」。

模型 + 數據:打造「真實基座 + 生成增強」數據生產範式

而這種「在訓練中見過足夠多不完美」的能力,並非憑空而來。它觸及一個更底層的命題:模型的認知邊界,受到其所接觸數據的影響。高質量數據,恰恰是具身訓練中最稀缺、也最具決定性的變量。智象極力打造的「模型+數據」雙驅動策略,正是問鼎具身世界模型榜單的真正護城河。

該策略的關鍵突破口,在於讓數據生產本身成為模型迭代的有機一環。為此,智象探索出「真實基座 + 生成增強」的數據生產範式。模型不再是被動接收數據,而是主動參與數據的創造。

以與諾亦騰的合作為例:其高精度真人動作捕捉數據作為真實底座,智象借助原生全模態能力完成百倍級的數據精細化擴增。基於單段真實動作樣本,模型可以生成變體視頻:在嚴格遵守物理約束不變的前提下,切換背景環境、光照條件、物體形態等變量,產出海量多元訓練樣本。

這一機制的關鍵,在於模型既做「考生」,也做「出題人」——它根據自身所需主動生成針對性訓練樣本,形成數據與模型互相驅動的增長飛輪。最終讓 HiDream-O1-Embodied 在面對現實世界的強擾動時,展現出超乎尋常的魯棒性。

原生全模態世界模型矩陣日臻完善

就在不到一個月前,智象剛剛發布了交互式世界模型 HiDream-O1-World,並在交互式視頻世界模型評測基準 WBench 的 Navi 分榜中,以平均分 80.9 登頂榜首。

交互式世界模型解決的是「理解與推演」,讓 AI 在數字世界中具備對空間、時間、運動與物體關係的完整認知。而具身世界模型解決的是「操作與執行」,讓 AI 在物理世界中完成真實任務。兩者將形成有力互補,為原生全模態世界模型的發展築牢根基。

正如智象未來創始人兼 CEO 梅濤博士此前所言,下一代大模型競爭的關鍵,不在於單一模態能力的增長,而是從單模態走向多模態,並走向原生統一的全模態。

從 HiDream-O1-Image 到 HiDream-O1-World,再到 HiDream-O1-Embodied,智象作為創新型大模型企業,正堅定地逐步形成覆蓋視覺模型、交互式世界模型及具身世界模型的模型家族矩陣。這既是原生全模態技術在多領域鋪展的能力,更體現了其強大的內生進化能力。

站在世界模型前沿技術加速發展的時代拐點,智象正加速創新向前。


Hashtag: #HiDreamAI #智象未來

發佈者對本公告的內容承擔全部責任

【了解更多最快最新的財經、商業及創科資訊】

👉🏻 追蹤 WhatsApp 頻道 BusinessFocus

👉🏻 下載 BusinessFocus APP

👉🏻 立即Follow Instagram businessfocus.io

最新 金融投資熱話專頁 MarketFocus