download BusinessFocus app
全球AI视频模型第一梯隊再添中國力量:智象發佈首款物理規律導向视频模型

全球AI视频模型第一梯隊再添中國力量:智象發佈首款物理規律導向视频模型

Market Information Media OutReach
By Media OutReach on 17 Sep 2026
Media OutReach is the first full-service newswire company in Asia Pacific offering a totally integrated service of press release distribution and media monitoring with analysis service for the public relations and investors relations communities. Founded in 2009, the company is headquartered in Hong Kong with office in Singapore.

支援文字、圖片、影片等多模態輸入,可生成5至20秒1080p音畫一體化视频;首次參與兩項國際獨立評測即躋身全球前列

北京,中國 - Media OutReach Newswire - 2026年9月17日 - 全球大模型技術創新公司智象(HiDream.ai)正式發佈原生全模態视频生成模型HiDream-O1-Video-1.0(簡稱「HiDream V1」)。該模型以創作意圖與物理規律理解為核心,支援文字、圖片、影片等多模態輸入,可生成5至20秒1080p高保真影片,並在敘事規劃、人物一致性、物理合理性與音畫同步等方面實現全面升級。

全球AI视频模型第一梯隊再添中國力量:智象發佈首款物理規律導向视频模型


發佈同期,HiDream V1首次參與兩項國際獨立模型評測:在Artificial Analysis Image to Video Leaderboard(With Audio)中位列全球前四,在Arena.ai Image-to-Video盲測排行榜中位列第八,躋身全球视频生成模型第一梯隊。

國際雙榜首秀,躋身全球影片生成第一梯隊
Artificial Analysis透過標準化、可複現的基準測試,對全球主流AI模型進行獨立評估;Arena.ai則透過匿名比較與用戶投票,對不同模型的生成結果進行盲測。兩類評測機制分別從標準化測試與真實用戶偏好兩個角度,為影片生成模型的綜合能力提供第三方參考。

HiDream V1首次參與兩項評測即取得全球前列成績,體現其在畫面質素、指令遵循、動態表現、敘事連貫性與音畫協同等方面的綜合競爭力。值得一提的是,全球AI视频生成賽道競爭激烈,Seedance、MiniMax H3等中國團隊開發的模型已持續位居國際排行榜前列;HiDream V1首次參評即躋身前列,令中國力量在這一領域的陣容進一步壯大。

智象未來CTO姚霆表示:「影片生成的代際進化,不只是解像度的提升與時長的延伸,更重要的是模型能否真正理解創作者的意圖,以及真實世界中的物體、動作與聲音如何相互作用。HiDream V1從架構設計之初便面向文字、影片與音訊的統一表徵,推動影片生成從『看得清、動得順』,進一步走向『聽得懂、演得連貫、音畫相一致』。此次在兩項國際獨立評測中進入全球前列,是對智象未來原生全模態技術路線的階段性驗證。」

畫面高保真、敘事連貫性、人物一致性全面升級
針對高保真畫質、敘事連貫性與人物一致性等關鍵指標,HiDream V1實現全面優化升級。它不只追求單格畫面的精美,更要令影片內容在整體敘事維度上自洽。

人物、情緒、動機、物理規律一旦進入連續鏡頭,便必然互相影響。為此,智象提出「先規劃、後聯合生成、再以多模態Reward對齊」的技術思路,讓模型先在全局層面規劃敘事與角色狀態,再在聯合生成中約束畫面、動作與語義,最後以多模態獎勵訊號對齊畫質、連貫性與物理合理性。

原生全模態,更懂意圖與物理規律
影片生成的核心挑戰,正從單格畫質轉向對複雜意圖、連續動作與真實世界規律的綜合理解。

用戶的影片創作指令通常包含人物、動作、場景、鏡頭、對白與聲音等多層資訊。為提升複雜指令的執行效果,HiDream V1引入多模態意圖理解與規劃機制,在生成前對用戶需求進行結構化分析,統籌鏡頭時長、場景、角色狀態、動作表情、景別構圖、運鏡方式、對白與環境聲等要素。

基於「先理解、再規劃、後生成」的技術路徑,HiDream V1能夠從全局層面規劃敘事與角色狀態,並在生成過程中協調畫面、動作、語義與聲音,提升內容完整性、人物一致性與鏡頭連貫性。

物理規律理解是HiDream V1的另一項核心能力。模型將重力、慣性、碰撞、形變、材質、光影與空間連續性等因素納入生成邏輯,令物體運動、角色動作與環境回饋更符合真實世界規律。影片生成由此不再只是對視覺表象的模擬,而是進一步建立對動態世界運行方式的理解。

讓敘事內容決定影片時長
現時多數影片生成模型以預設時長為生成條件,內容需要遷就固定的時間窗口,容易出現動作結束後畫面繼續停留,或以慢動作延長內容等問題。

HiDream V1將時長納入敘事規劃,根據事件發展邏輯、動作完成週期與內容節奏,在5至20秒範圍內自主匹配生成時長。其核心並非簡單增減格數,而是讓影片長度服務於內容表達,使動作推進與敘事節奏更自然、完整。

這一機制意味着,用戶不必預先判斷內容需要多少秒,而可以更專注於描述希望表達的事件與結果,由模型自主規劃相應的時間結構。

文字、影片與音訊聯合建模
傳統AI视频生成通常採用「先生成畫面、後添加聲音」的分階段路徑,容易造成口型、動作、環境聲與物理音效之間的錯位。

HiDream V1採用原生全模態架構,對文字、影片與音訊訊號進行聯合建模,令三類資訊在同一生成過程中相互約束、協同生成。畫面運動影響聲音節奏,對白與音效參與鏡頭情緒塑造,文字條件貫穿整體生成過程,從而提升人物表達、環境變化與物理動作之間的同步性。

在後訓練階段,智象未來採用Diffusion Reinforcement Learning,並構建與人類認知及審美偏好對齊的多模態Reward模型,從畫質、語義、動作、物理合理性與聲音等多個維度對生成結果進行綜合評估,進一步提升影片整體的一致性與真實感。

世界模型閉環成形:從單點能力到原生全模態矩陣
HiDream V1並非一項孤立的模型發佈,而是智象原生全模態世界模型體系的關鍵組成部分。

基於UiT(Unified Transformer)統一底座,智象未來已形成四大模型產品線:

  • HiDream-O1-Image:面向圖像理解與生成;
  • HiDream-O1-Video:面向動態內容生成與時間敘事;
  • HiDream-O1-World:面向三維環境模擬與實時交互;
  • HiDream-O1-Embodied:面向具身智能的空間推理、動作規劃與回饋。

四類模型並非彼此獨立的能力模組,而是在統一技術架構下同源演進,分別覆蓋空間理解、時間建模、三維交互與具身行動等關鍵環節,共同構建對真實世界的感知、理解、生成、交互與行動能力。

早前,HiDream-O1-Image商用版1.5曾在Artificial Analysis文生圖排行榜中位列全球第二、中國第一,其開源版本亦曾位列該排行榜第二;HiDream-O1-World曾在交互式世界模型評測基準WBench綜合排行榜中位列第一;HiDream-O1-Embodied曾在RoboColiseum的擾動適應與空間推理分項排行榜中取得第一。

智象創辦人兼CEO梅濤博士表示:「我們所構建的,不是四條彼此獨立的模型產品線,而是一套以統一技術架構為底座、面向真實世界持續演進的原生全模態體系。下一代大模型的競爭,不僅取決於單項能力的提升,更取決於不同模態能否在統一架構下實現共同理解、生成與交互。」

從理解世界、生成世界,到模擬世界、作用於世界,智象未來原生全模態世界模型閉環由此進一步成形。

C+輪融資落實,國資產業資本聯手加碼
在HiDream V1發佈同期,智象宣佈完成C+輪融資,本輪投資方包括新微資本、交子資本與工銀資本。本輪融資將用於原生全模態模型研發、產品迭代、算力基礎設施建設及行業應用拓展。

新微資本由上海新微科技集團、上海科創投集團及管理團隊共同發起成立,管理基金規模近百億元(人民幣)。作為新微集團的企業風險投資平台(CVC),新微資本持續加強在人工智能領域的投資佈局,並依託新微集團在集成電路特色工藝製造領域的產業基礎,推動人工智能基礎設施、模型技術與終端應用協同發展。

交子資本是成都交子金融控股集團旗下全資國有股權投資平台,也是成都建設西部金融中心的重要產業資本載體。該機構聚焦人工智能等硬科技領域,透過長期資本與產業資源推動科技成果轉化與產業生態建設。

隨着HiDream V1正式發佈,智象從原生全模態走向世界模型的技術路線,正從戰略藍圖轉化為由統一底座、模型矩陣與產品能力共同支撐的現實體系。

HiDream V1目前處於內部測試階段,計劃於近期開放使用。可透過以下連結體驗:https://hiharness.ai/


Hashtag: #智象 #HiDreamAI

發佈者對本公告的內容承擔全部責任

【了解更多最快最新的財經、商業及創科資訊】

👉🏻 追蹤 WhatsApp 頻道 BusinessFocus

👉🏻 下載 BusinessFocus APP

👉🏻 立即Follow Instagram businessfocus.io

最新 金融投資熱話專頁 MarketFocus