這項由牛津大學視覺幾何組(Visual Geometry Group)主導的研究,以預印本形式于2026年7月發(fā)表,論文編號為arXiv:2607.05392。研究團隊提出了一套名為SynCity 3000的框架,目標直指一個讓游戲設計師、電影制作人和虛擬世界創(chuàng)作者都魂牽夢縈的問題:能不能讓計算機自動幫我們"憑空建造"一座完整的三維城市,或者一片山林,或者一個游樂場?
這個問題聽起來輕描淡寫,背后卻藏著巨大的技術鴻溝?,F(xiàn)有工具要么只能生成單個物品——比如一把椅子、一棟建筑——要么在拼接多個區(qū)域時留下明顯的"拼縫",就像用形狀不齊的地磚鋪地,怎么看都覺得哪里不對勁。SynCity 3000的核心貢獻,就是找到了一種讓整個世界"渾然天成"而非"東拼西湊"的生成方式。
為了幫助理解這套系統(tǒng),可以借用一個日常場景來貫穿全文:把整個3D場景生成過程,比作一位畫家先畫出一張完整的鳥瞰草圖,再由一組工匠照著這張草圖把城市"立體雕刻"出來。這個"先畫草圖、再雕刻實體"的兩步流程,正是SynCity 3000的根本邏輯。
(資料圖)
一、為什么"拼磚塊"的老方法行不通
假設你想用樂高積木搭一座城市。最簡單的方法是先把城市切成一塊塊方格,每塊單獨搭好,然后拼起來。這正是SynCity 3000的前身——SynCity——所采用的策略。它把整個場景切成一個個"瓷磚",每塊瓷磚單獨生成,生成完再拼在一起。
這個方法確實能用,但問題也相當明顯:拼接處的痕跡很難消除。就像你把不同品牌的瓷磚鋪在同一塊地板上,顏色和花紋總有細微差異,走近看一眼就會發(fā)現(xiàn)"這里有條縫"。更棘手的是,某些大型結構——比如一條穿越整個場景的河流,或者一座占地寬廣的城堡——根本沒辦法被整齊地塞進一個固定大小的格子里,必然會被硬生生切斷。
SynCity 3000要解決的,正是這個"拼縫問題"。研究團隊不再把世界切成碎片分別處理,而是讓整幅"草圖"在一次連貫的過程中同時成形,讓每個局部在生長時都能感知到周圍發(fā)生了什么。
二、第一步:畫出整張世界的"鳥瞰草圖"
在SynCity 3000的比喻框架里,第一位"畫家"負責生成整個場景的二維模板圖。這張圖采用一種叫做"斜二測畫法"(dimetric view)的視角——簡單說,就是像經(jīng)典游戲《文明》或《模擬城市》里那種斜45度俯視的視角,既能看到地面布局,又能看到建筑的高度感。
研究團隊使用了一種叫做"潛在擴散模型"(latent diffusion model)的圖像生成技術。這類技術的核心原理可以這樣理解:計算機在一堆噪聲中,通過不斷"去噪",逐漸把一張清晰的圖像還原出來,就像雕刻家在一塊粗糙的石頭里慢慢鑿出人像。
但這里有個現(xiàn)實限制:這類圖像生成模型一次只能生成固定尺寸的圖像,就好像一位畫家手邊只有一張A4紙,卻要畫一張城市全貌圖。SynCity處理這個問題的方式,是分張紙畫、再貼在一起;而SynCity 3000的處理方式更聰明——它讓畫家在畫每一小塊區(qū)域時,都能同時看到旁邊區(qū)域目前的進展,從而保證整體連貫。
技術上,這套機制受到了一篇名為MultiDiffusion的研究的啟發(fā)。具體做法是:把整張"畫布"(即潛在空間的編碼網(wǎng)格)切成多個互相重疊的"窗口",每個窗口分別交給圖像生成模型處理,然后在每一步"去噪"時把所有窗口的結果平均融合。這種"共享信息、協(xié)同去噪"的方式,讓不同區(qū)域的內容在生成過程中自然地協(xié)調一致,而不是事后硬拼。
除了全局的一致性,這套系統(tǒng)還支持"局部約束"——用戶可以指定某個區(qū)域必須包含特定內容,比如"這里要有一座木質過山車"或者"這個角落放一個旋轉木馬"。這些約束作為額外的"條件窗口"加入到生成流程中,與全局風格和局部內容約束同時發(fā)揮作用,從而實現(xiàn)精細化的布局控制。
值得一提的是,用戶甚至可以完全不自己寫約束,直接讓大語言模型(比如ChatGPT)來生成這些布局指令。研究團隊展示了一套提示詞模板,能夠讓AI自動設計出各種風格各異的世界——從中世紀小鎮(zhèn)到科幻城市,從山地公園到工業(yè)港口。
三、第二步:照著草圖,把整個世界"雕刻"成立體
草圖畫好之后,第二位"工匠"登場,負責把這張二維圖像變成真正的三維場景。SynCity 3000的最終輸出是一種叫做"三維高斯點云"(3D Gaussian Splats)的表示方式——這是近年來在計算機圖形學領域迅速崛起的一項技術,可以從任意角度渲染出高質量的三維畫面,就像一個由無數(shù)個微小彩色氣泡構成的立體世界,每個氣泡都攜帶著顏色和透明度信息。
研究團隊選擇在一個名為TRELLIS的現(xiàn)有模型基礎上進行改造。TRELLIS原本是一個"看圖生成單個3D物體"的工具,比如你給它看一張椅子的圖片,它能輸出一把三維的椅子。但SynCity 3000需要的是處理整個場景——這就好比原本只會雕刻一個人像的工匠,現(xiàn)在要同時雕刻一整座廣場。
TRELLIS內部有兩個主要的工作階段。第一階段叫做"稀疏結構生成",負責確定三維空間里哪些格子(體素,可以理解為三維的"像素")是有物體的,哪些是空的——類似于用樂高磚塊搭出一個粗糙的骨架。第二階段叫做"結構化潛碼生成",負責為每個有物體的格子填充詳細的外觀和形狀信息——類似于給骨架上色并雕刻細節(jié)。最后,這些信息被解碼成最終的三維高斯點云。
把這套流程擴展到整個場景,關鍵挑戰(zhàn)在于:TRELLIS原本的"大腦"(一種叫做擴散變換器的神經(jīng)網(wǎng)絡)一次只能處理固定大小的區(qū)域,沒辦法直接應用于更大的場景。研究團隊采用的解決方案,與第一步中處理二維草圖的思路如出一轍——滑動窗口加協(xié)同去噪。
具體來說,整個場景的三維潛碼被劃分為多個互相重疊的窗口,每個窗口對應草圖中的某個區(qū)域。模型在處理每個窗口時,不僅能看到該區(qū)域對應的草圖內容,還能看到相鄰區(qū)域已經(jīng)生成的三維信息作為"上下文"——就像工匠在雕刻某個區(qū)域時,能看到旁邊已經(jīng)雕好的部分,從而確保銜接順暢。
為了確保模型聚焦于正確的區(qū)域,研究團隊還對輸入草圖進行了遮罩處理:只把當前窗口對應的那片草圖區(qū)域展示給模型,遮住其余部分。這就像工匠只看著當前正在雕刻的那塊區(qū)域的設計圖,避免被整體圖案"帶偏"。同時,鄰近區(qū)域的三維信息作為"背景參考"傳入模型,但模型只對當前窗口的核心區(qū)域負責生成預測,不對參考區(qū)域做出改動。
所有窗口在每個去噪步驟中并行處理,各自產(chǎn)生的預測結果通過加權平均的方式融合,從而讓整個場景在統(tǒng)一的節(jié)奏下協(xié)調生長。
四、訓練數(shù)據(jù)從哪來?研究團隊自己造了個"數(shù)據(jù)工廠"
現(xiàn)有的大規(guī)模三維數(shù)據(jù)集幾乎都是針對單個物體的,比如椅子、杯子、汽車等,而場景級別的三維數(shù)據(jù)非常稀缺。要讓TRELLIS學會處理場景,就必須有場景級別的訓練數(shù)據(jù)——但這種數(shù)據(jù)幾乎不存在,更別提符合SynCity 3000特定訓練格式的數(shù)據(jù)。
面對這個困境,研究團隊選擇了自己動手,豐衣足食。他們設計了一套"合成數(shù)據(jù)生成引擎",可以在不需要任何真實場景數(shù)據(jù)的情況下,自動生成大量用于訓練的人工場景。
這套引擎的運作方式頗為有趣:首先隨機生成一塊地形表面,用幾種隨機顏色按照隨機的硬邊界涂色(就像抽象畫里的色塊),營造出地面的多樣感;然后從一個名為Objaverse-XL的海量三維物體數(shù)據(jù)庫中隨機挑選一些物體,隨機縮放后放置在地面上,同時確保它們不會離地面邊緣太近;接著用頂光和隨機的額外光源照亮場景,制造陰影效果。整個過程高度隨機,幾乎每次運行都會產(chǎn)生完全不同的場景組合。
生成場景之后,引擎會用斜二測畫法拍攝一張渲染圖作為"草圖",同時把場景體素化,并為每個體素注入從多個角度拍攝的視覺特征(利用DINOv2這個圖像理解模型提取的特征)。這樣就得到了一對"輸入草圖+三維數(shù)據(jù)"的訓練樣本。
研究團隊用這套引擎一共生成了32萬個訓練樣本。這個數(shù)量遠超此前同類工作中使用的訓練數(shù)據(jù)規(guī)?!鳛閷Ρ龋粋€名為NuiScene的類似系統(tǒng)只用了43個真實場景進行訓練。
五、如何讓模型在"新任務"中不忘記"老本領"
把TRELLIS改造成能處理整個場景的系統(tǒng),需要對它進行微調(fine-tuning)——也就是在新的訓練數(shù)據(jù)上繼續(xù)訓練,讓它適應新的任務形式。但這里有個微妙的風險:如果訓練過度,模型可能會"忘記"它原本生成高質量單個三維物體的能力,就像一個鋼琴家被要求專門練交響樂,結果生疏了獨奏技巧。
為了防止這種"災難性遺忘",研究團隊設計了兩種交替出現(xiàn)的訓練目標。一種是"含上下文"模式:給模型提供當前核心區(qū)域加上周圍鄰近區(qū)域的三維信息,讓它學會如何在感知整體環(huán)境的情況下填充局部細節(jié)。另一種是"不含上下文"模式:只給模型提供核心區(qū)域,沒有任何周圍信息——這幾乎和原始TRELLIS的訓練任務完全相同。兩種模式各以50%的概率隨機出現(xiàn),訓練時損失函數(shù)只計算核心區(qū)域的誤差,不懲罰對上下文區(qū)域的處理。
這種雙目標交替訓練的設計,讓模型在學會"看全局、雕局部"的新本領的同時,不會丟失原本精雕細刻單個物體的能力。
六、實驗結果說明了什么
研究團隊從多個維度對SynCity 3000進行了評估,最直接的一項是"模板忠實度"——也就是生成的三維場景和原始草圖有多相似。他們生成了35張隨機主題的場景草圖,然后分別用SynCity 3000、TRELLIS(原版)、TripoSG以及Hunyuan3D-2.1來生成對應的三維場景,最后從與草圖相同的視角渲染,用三個圖像相似度指標(LPIPS、SSIM、PSNR)進行比較。
在這三個指標上,SynCity 3000均優(yōu)于其他方法。原版TRELLIS的問題在于它的輸出分辨率有限,處理大場景時細節(jié)會變得模糊;TripoSG和Hunyuan3D-2.1則更嚴重,不僅顏色還原差,幾何結構也可能出現(xiàn)空洞和錯誤——這兩個工具在7個場景上甚至直接失敗,被排除在最終比較之外。
研究團隊還專門評估了幾何重建質量,使用合成場景作為"有真實答案可對照"的測試用例,計算了倒角距離(Chamfer Distance)和F分數(shù)等幾何精度指標。測試分兩種尺寸進行:標準尺寸(1344×672像素模板)和大尺寸(2240×1120像素模板)。結果顯示,隨著場景尺寸增大,TRELLIS的幾何精度明顯下降,而SynCity 3000的表現(xiàn)則保持穩(wěn)定,在大尺寸場景上的優(yōu)勢尤為明顯。
用戶研究的結論更為直接。研究團隊招募了27名用戶,以強制二選一的方式進行多組比較。在布局控制方面,所有用戶(100%)都認為SynCity 3000提供的布局控制方式比SynCity更靈活自由。在三維重建忠實度方面,71.6%的用戶認為SynCity 3000比TRELLIS原版更準確,對比TripoSG和Hunyuan3D-2.1時則達到了100%的優(yōu)勢。在整體場景偏好方面,SynCity 3000分別以63%、74.1%、59.3%和78.6%的勝率擊敗了SynCity、NuiScene、3DTown和使用SynCity 3000草圖但用原版TRELLIS生成三維的版本。研究團隊還請用戶對場景的"視覺合理性"打分(1分最不合理,5分最合理),SynCity 3000的平均得分為3.57分。
七、細節(jié)決定成?。簬讉€關鍵設計選擇的影響
研究團隊還通過消融實驗(ablation study)——也就是逐一去掉某個設計,觀察效果有多大變化——來驗證各個設計決策的必要性。
不進行任何微調、直接使用原版TRELLIS處理場景草圖時,效果最差,主要原因是原版模型會試圖為場景找一個"正面朝向",但場景不像單個物體那樣有明確的正面,導致生成結果混亂。
去掉"上下文窗口"(即不讓模型看到鄰近區(qū)域的三維信息),效果有所下降,說明感知周圍環(huán)境對于填充局部細節(jié)確實有幫助。把上下文范圍縮?。◤恼撐脑O定的V=8縮減到V=4),效果進一步下降,說明模型能夠捕捉到相當長范圍的空間依賴關系,上下文不能太小。
把滑動窗口的步長調大(相當于相鄰窗口之間的重疊減少,甚至沒有重疊時),效果也會明顯變差。這是因為重疊窗口之間的平均融合,能夠有效解決遮擋帶來的歧義——比如一棟高樓的背面在草圖里被遮住了,到底該如何生成?多個重疊窗口從不同角度"投票",能夠大大減少重復或錯誤結構的出現(xiàn)概率。
八、這套系統(tǒng)還有哪些局限和未來方向
SynCity 3000并非沒有短板,研究團隊對此相當坦誠。
首先是視角的強制性。整套系統(tǒng)要求場景必須以斜二測畫法呈現(xiàn),這是為了保證草圖和三維生成之間的對應關系。這意味著它不適合處理第一人稱視角或正面透視的場景。未來或許能找到不依賴固定視角的生成方式。
其次是紋理細節(jié)的輕微損失。由于使用了重疊窗口加權平均的機制,相比原版TRELLIS直接生成單個物體時,最終紋理的銳利度會略有下降。
再者是偶發(fā)的結構重復問題。當場景中有非常高大或占地寬廣的結構時,窗口裁切帶來的遮擋可能讓模型誤判,偶爾會在相鄰區(qū)域生成重復的結構。使用更小的步長(即更密集的窗口重疊)可以顯著緩解這個問題。
此外,生成結果整體偏向"游戲風格"或卡通化,真實感有所欠缺。這主要源于訓練數(shù)據(jù)Objaverse-XL本身的風格偏向(里面有大量人類創(chuàng)作的卡通風格三維模型),以及FLUX圖像生成模型對斜二測畫法場景的固有偏好。這一特征在SynCity中同樣存在。
最后是生成速度。在單塊NVIDIA RTX A6000顯卡上,生成一個標準尺寸的場景大約需要30分鐘(三維部分),更大的場景則耗時更久,并且隨場景尺寸呈平方級增長。在NVIDIA H100上測試的數(shù)據(jù)顯示,1344×672像素模板需要31分鐘,2240×1120像素需要82分鐘,3136×1568像素則需要約3小時,同時顯存占用也從46GB逐步增加至56GB。
說到底,SynCity 3000干成了一件看起來簡單、做起來極其復雜的事情:讓一臺計算機從一句文字描述出發(fā),自動生成一個可以從任意角度觀看的完整三維世界,而且這個世界在視覺上是連貫一致的,不會出現(xiàn)明顯的拼接痕跡。這對游戲開發(fā)、影視制作、虛擬現(xiàn)實內容創(chuàng)作來說,都意味著一個重要的可能性:原本需要團隊花費大量時間手工搭建的場景,未來或許可以從草圖一鍵生成,創(chuàng)作者把更多精力留給創(chuàng)意本身,而不是繁瑣的手工建模。
當然,這項技術目前還處于研究階段,生成速度、真實感和對某些特殊場景的支持,都還有提升空間。但從整個領域的發(fā)展軌跡來看,這類研究正在快速推進三維內容生成的邊界。有興趣深入了解技術細節(jié)的讀者,可以通過arXiv編號2607.05392查閱完整論文。
Q&A
Q1:SynCity 3000和普通的三維建模軟件有什么區(qū)別?
A:普通三維建模軟件(比如Blender、3ds Max)需要用戶手動繪制每一個物體的形狀、貼圖和位置,是純手工制作。SynCity 3000則是一套自動生成系統(tǒng),用戶只需提供文字描述,系統(tǒng)就能自動生成完整的三維場景。它的核心是把圖像生成AI和三維重建AI結合在一起,先生成二維場景草圖,再把草圖轉成三維模型,全程不需要人工建模。
Q2:SynCity 3000生成的場景可以在游戲引擎里直接用嗎?
A:SynCity 3000的輸出格式是"三維高斯點云"(3D Gaussian Splats),這是一種近年來興起的三維表示方式,可以從任意角度高質量渲染。目前主流游戲引擎(如Unreal Engine、Unity)對這種格式的原生支持還在逐步完善中,可能需要轉換工具或插件才能直接使用。研究團隊的目標主要是展示場景生成的可行性,后續(xù)的工程集成還需要進一步工作。
Q3:SynCity 3000需要什么樣的硬件才能運行?
A:根據(jù)論文中的實驗數(shù)據(jù),研究團隊在NVIDIA RTX A6000和NVIDIA H100級別的專業(yè)GPU上進行了測試。生成一個標準場景大約需要30到180分鐘不等,顯存需求在46GB至56GB之間,遠超普通消費級顯卡。目前這套系統(tǒng)還處于研究階段,并不是面向普通用戶的消費級產(chǎn)品,對硬件要求相當高。
營業(yè)執(zhí)照公示信息