路徑之爭:高德 ABot-Earth0.5 三個工程突破,讓原生 3D 城市生成走出實驗室
3D 城市生成長期走同一條路:採集海量 2D 影像,再從中蒸餾出 3D 結構。
3D 城市生成長期走同一條路:採集海量 2D 影像,再從中蒸餾出 3D 結構。這條路不是沒有成果,但幾何一致性的天花板早被業界看透,終究是用二維像素在猜三維世界。
6 月 8 日,高德發布 ABot-Earth0.5,正面換路線。這個模型完全以 3D 數據原生訓練,端到端直出 3DGS(3D Gaussian Splatting)格式的城市場景,輸入一張衛星圖或一段文字描述,即可在消費級單卡生成。高德官方宣稱效率較傳統模式提升約 1000 倍(未經第三方實測)。
換路線的宣言容易說,工程難題才是真正的看點。ABot-Earth0.5 的核心突破有三個。
其一,直接面向 3DGS 點雲的壓縮—生成框架。3DGS 場景動輒包含數百萬基元,且本質無序,無法像像素網格一樣直接餵入大模型。高德的解法是先將點雲壓縮進緊湊隱空間,讓模型在隱空間學習生成、再解碼回 3DGS,理論上同時解決計算量與序列無序兩個障礙。
其二,滑窗推理(Sliding-Window Inference)。公里級場景無法一次推理完成,分塊生成容易在邊界出現接縫。滑窗機制在重疊區做智能融合,讓相鄰塊平滑過渡,目前看來是實現廣域連續生成的關鍵工程手段。
其三,跨域自適應模組。衛星影像與地面 3D 掃描數據之間存在分辨率域差,直接作為條件輸入會讓模型錯位。這個模組橋接了域差,同時內建多層次細節解碼器(LOD),輸出自帶遠近景深,無需後處理即可適配不同視距漫遊。
高德的護城河在數據:原生 3D 訓練的先決條件是夠多真實 3D 場景,這不是一般研究機構能快速複製的積累。輸出格式原生相容 Unity 與 Unreal Engine,加入互動邏輯即可投入生產,把研究原型直接接上工具鏈終端。
對做世界模型或空間智能的工程師,這裡有一個值得對照的路線判斷:原生 3D 訓練在幾何一致性上理論上比 2D 蒸餾更穩,因為模型從不需要從壓平的像素還原深度。「1000 倍效率」目前仍是官方口徑,需要技術報告與社群實測來校正。內測申請現已開放(abot-earth.amap.com),做自駕仿真、遊戲場景生成或城市數字孿生的團隊,值得親手跑一遍,看這條原生 3D 路線的實際交付品質能否撐起這個宣稱。


