大部分關(guān)注GPU的同學(xué)都知道,近代NVIDIA GeForce RTX GPU,里面也充斥著所謂的Tensor core。一般我們說Tensor core是用于AI與HPC計(jì)算加速的,或者說用于加速矩陣乘運(yùn)算。從Volta架構(gòu)開始,到現(xiàn)在的Ada Lovelace/Hopper架構(gòu),Tensor core已經(jīng)走到“第四代”了。
Tensor core并不是傳統(tǒng)意義上的圖形渲染單元——它的存在也一定程度讓GPU變得不再那么Graphical...從我們能找到的數(shù)據(jù)來看,早在Turing架構(gòu)時期,Frizchens Fritz公開TU106(Turing)的高分辨率紅外die shot,提到TU106的一個TPC(Texture Processing Cluster)占die面積約為10.89mm²,其中的Tensor core大約1.25mm²——包含ALU、scheduler、cache相關(guān)部分。

Turing架構(gòu)TU106 die shot,來源:Frizchens Fritz
從整個GPU die的角度來看,TU106的Tensor core占die面積大約在10%左右——當(dāng)然這個數(shù)字未必可靠,因?yàn)槲覀冞€從其他來源聽說,Turing時代的這一數(shù)值可能在20%左右;無論如何,這起碼說明了傳統(tǒng)圖形處理器上,至少已經(jīng)有這么大一片晶體管是“不務(wù)正業(yè)”的了。
這已經(jīng)是前兩年的數(shù)字了,TU106的Tensor core單純看核心數(shù)是288個;這一代AD102(Ada Lovelace)的Tensor core數(shù)量已經(jīng)增加到576個(RTX 4090并未全部用上這些核心);換句話說現(xiàn)在的GeForce圖形卡,用在AI上的料可著實(shí)不少了。
這就涉及到一個問題,AI對于游戲和圖形視覺類應(yīng)用究竟有什么價值?這些die size拿來堆shader core之類的圖形單元他不香嗎?現(xiàn)在的AI計(jì)算,于游戲應(yīng)用的一個重要價值在于:生成(generate)像素與幀——它和圖形單元的區(qū)別在于,后者是渲染(render)像素與幀。
“生成”和“渲染”有啥不同呢?說點(diǎn)兒實(shí)際的,NVIDIA最新的DLSS 3技術(shù)支持超分辨率(Super Resolution)和幀生成(Frame Generation):玩?zhèn)€1080p分辨率的游戲,如果超分辨率到4K分辨率,就有75%的像素和一半的幀是AI生成的,而不是由圖形渲染單元算出來的。而Tensor core投入的die size,遠(yuǎn)遠(yuǎn)不到圖形渲染單元的一半,功耗更是低了不止一個數(shù)量級,這筆投入是不是還挺劃算的?
也就是說,如果這些像素和幀都要由圖形單元去算,那所需的晶體管數(shù)量、顯卡售價、功耗水平都會沖著爆炸級別而去。最近NVIDIA在上海辦了一場GeForce RTX 40系顯卡品鑒會——這次品鑒會的主題之一就是DLSS 3,當(dāng)然相關(guān)的還有全景光線追蹤,以及OEM產(chǎn)品展示。不過我們重點(diǎn)就關(guān)注一下和AI關(guān)系最大的DLSS 3,以及其他與GeForce顯卡相關(guān)的AI技術(shù)。
做游戲、做動畫也用AI的話...
去年NVIDIA GTC開發(fā)者大會上,我就寫文章說游戲方面讓人眼前一亮的是一個叫RTX Remix的工具,這個工具能給一些DirectX 7/8老游戲做MOD,讓老游戲也立馬支持光線追蹤、DLSS之類的新技術(shù)。NVIDIA演示的《上古卷軸3:晨風(fēng)》加上RTX之后的效果,的確堪稱驚艷。
這次我們在品鑒會上看到了當(dāng)時NVIDIA親自下場給游戲《傳送門:序曲》,基于RTX Remix做的《傳送門:序曲》RTX版,讓這個2008年度最佳游戲,看起來跟現(xiàn)在的新游戲似的。就玩家層面來看,和AI技術(shù)最相關(guān)的自然是DLSS——不過有關(guān)DLSS 3的部分,我們放到后面再去談。

這里NVIDIA 作為開發(fā)者與《傳送門:序曲》(Portal Prelude) 的原創(chuàng)Nicolas "NykO18" Grevet以及著名Mod愛好者David "Kralich" Driver-Gomm合作對《傳送門:序曲》RTX版進(jìn)行現(xiàn)代重構(gòu)時,本身也是受惠于AI的。如果你仔細(xì)閱讀了我們剖析RTX Remix的技術(shù)文章會了解,RTX Remix并不單純是給老游戲加上光追、DLSS之類的支持這么簡單。
這套工具里面有個AI紋理工具——一方面能夠?qū)⒌头直媛实馁Y源(asset)upscale為4倍高分辨率,比如1080p分辨率就upscale為4K;另一方面,AI可以對老游戲中的紋理進(jìn)行inference,將比較老舊的紋理,轉(zhuǎn)為某種材質(zhì)精美的紋理,NVIDIA在此前的媒體會上稱其為“Re-Texturing”,AI紋理工具“看到”畫面以后,能夠“理解畫面原本想要呈現(xiàn)的材料”,比如看到一扇木頭門,就能很快用高分辨率、高質(zhì)量的木質(zhì)紋理對原有紋理做替換。
那么很顯然這里的AI紋理工具,是首先需要NVIDIA去做個網(wǎng)絡(luò)模型的。NVIDIA方面說是對游戲紋理的大量圖片做了訓(xùn)練,這樣的網(wǎng)絡(luò)可應(yīng)用于紋理、物理屬性之類的推理。是不是還感覺挺神奇的?

《上古卷軸3:晨風(fēng)》開關(guān)RTX前后變化
我們在這次品鑒會上問了NVIDIA,除了DLSS這樣的技術(shù),在游戲?qū)I的利用上還有什么樣的規(guī)劃。NVIDIA談到了NVIDIA Omniverse ACE(Avatar Cloud Engine)已經(jīng)在和“開發(fā)者合作中”,“后續(xù)應(yīng)該就會有比較好的呈現(xiàn)”。
去年GTC報(bào)道中我們談過ACE,這兩年在網(wǎng)上還挺火的Toy Jensen——就是那個黃仁勛3D卡通形象,也部分基于ACE;還有包括Violet、Tokkio之類的虛擬形象應(yīng)用,都有ACE技術(shù)成分。去年我還撰文談過Toy Jensen這個角色形象身上存在多少種不同的AI技術(shù)和“microservices”,包括Audio2Face生成式AI——基于音頻就能構(gòu)建臉部動畫、Riva——將單純的文本說出來的text-to-speech、Nemo生成式AI——可以理解為針對特定領(lǐng)域的定制版ChatGPT等等...

從最簡化的工作框圖來看,文字、音頻、視頻數(shù)據(jù)輸入到ACE網(wǎng)絡(luò),就能輸出2D或者3D形象(模型訓(xùn)練流程應(yīng)該是在DGX Cloud上進(jìn)行的)。從NVIDIA市場宣傳老是愛換某些概念的名字和定位(不是...)的傳統(tǒng)來看,ACE未來囊括的AI技術(shù)應(yīng)該會持續(xù)擴(kuò)展。
那么很容易想見,將這些應(yīng)用到游戲開發(fā)中會有怎樣的化學(xué)反應(yīng)。前兩個月的Computex上,黃仁勛特別發(fā)布了NVIDIA ACE 游戲開發(fā)版,用于構(gòu)建游戲中的NPC,NPC的角色反應(yīng)通過生成式 AI 變得更智能。想象游戲中的NPC都有ChatGPT般的聊天能力...
我們現(xiàn)在暫時還不清楚,將來基于ACE的網(wǎng)絡(luò)模型inference具體會怎么做。不過聽NVIDIA的意思,具體到玩家這一側(cè),與NPC對話的AI inference可能是由GeForce顯卡的Tensor core來完成的。
我倒是覺得,這對Tensor core的利用相比DLSS更為充分了。雖然這東西一聽就知道,又是個需要生態(tài)和開發(fā)者支持的大工程——好在從現(xiàn)有市場來看,NVIDIA生態(tài)構(gòu)建能力,在圖形和AI領(lǐng)域都是無出其右的,DLSS不是發(fā)展得就挺好么。

AI短片《Flower》
內(nèi)容創(chuàng)作部分,最后再來談一個品鑒會上的demo:NVIDIA請來了B站up主特效小哥008和拓星研究所的達(dá)威,展示他們用AI輔助制動的特效短片《Flower》——后續(xù)應(yīng)該也會在B站發(fā)布。據(jù)說這個短片在AI輔助創(chuàng)作下,4個人只用了5天時間完成,008說按照以往的流程,這樣一個短片可能需要長達(dá)1個月的時間去制作。
從現(xiàn)場聽到的介紹來看,該短片制作至少用到兩個AI相關(guān)的工具,其一是NVIDIA Canvas——這應(yīng)該也是現(xiàn)在Omniverse生態(tài)里的工具,即在畫布上,用筆刷簡單畫幾筆,Canvas就能基于AI自動生成photorealitic真實(shí)風(fēng)格的風(fēng)景畫。今年CES上,NVIDIA對此做了更新,新特性叫Canvas 360,即開始支持360°全景圖——構(gòu)成環(huán)繞場景。
《Flower》的創(chuàng)作應(yīng)該就是基于Canvas 360特性,CG短片的背景是用Canvas完成的。感覺比較奇特的是,Canvas 360特性中,創(chuàng)作者可以構(gòu)建等矩陣(equirectangular)環(huán)境圖,導(dǎo)入到3D應(yīng)用里——然后就能改變場景光照,增加反射之類的。008告訴我們,Canvas生成的山、云等背景,對于短片制作非常方便。

品鑒會現(xiàn)場用筆記本演示Canvas應(yīng)用
其二是Stable Diffusion——這個text-to-image生成式AI,大部分同學(xué)應(yīng)該也很熟悉了。“搭好場景,渲染好之后,丟進(jìn)Stable Diffusion,讓AI去做更進(jìn)一步的工作。”“AI幫我們填充了很多東西”,比如機(jī)器人身上的金屬劃痕細(xì)節(jié)、“手部細(xì)節(jié)”,“這些都是原資產(chǎn)里沒有的,AI填補(bǔ)出來的”;在模型精度較低的情況下,“AI幫我們填充了很多想要的細(xì)節(jié)”。
不過整個短片制作應(yīng)當(dāng)不僅限于這兩個AI構(gòu)成,包括動作捕捉(Move AI),以及文字腳本、視頻最后總結(jié)的一行字甚至也都是AI完成的。全部工作流用上了“4張40系顯卡,結(jié)果還是挺夢幻的”,008說。
NVIDIA現(xiàn)場也提到了自家AI工具的一些合作應(yīng)用案例,比如Canvas已經(jīng)在火星時代做應(yīng)用;好像每年GTC或者包括SIGGRAPH、Computex之類的會,NVIDIA都要宣布一堆AI相關(guān)的新合作,多少也是要表明自家AI生態(tài)的構(gòu)建情況。
我們在這部分談《傳送門:序曲》RTX版游戲、NVIDIA ACE 游戲開發(fā)版,以及《Flower》短片的這三個例子,都是要說明AI技術(shù)于游戲開發(fā)和內(nèi)容創(chuàng)作,正在扮演越來越重要的角色,Tensor core在娛樂與生產(chǎn)力方向也正變得預(yù)發(fā)重要。
其實(shí)我們始終覺得,現(xiàn)在的AI應(yīng)用,于創(chuàng)作流程仍然只呈現(xiàn)出了點(diǎn)狀,就好像《Flower》短片制作,是某些地方用上AI做輔助;生產(chǎn)力、游戲,和多媒體創(chuàng)作上,AI的參與度未來還會越來越深入,尤其是在生成式AI為這個路徑指明了方向以后。
從NVIDIA Omniverse和AI這兩大板塊的加速庫到應(yīng)用框架,仍然可以看到很多東西可在游戲、生產(chǎn)力上做應(yīng)用的潛力;而且這里還沒有談到AR/VR之類的部分。舉個例子,我記得去年GTC上,黃仁勛展示了某個AI-powered character,這些角色基于人類動作數(shù)據(jù)來學(xué)習(xí)人類的真實(shí)動作,包括走路、跑步、揮劍——據(jù)說角色訓(xùn)練機(jī)制原本要求10年期的模擬,但基于大規(guī)模并行GPU模擬,只需要現(xiàn)實(shí)世界3天就訓(xùn)練完成。

訓(xùn)練完成后的角色掌握各種技能,還能執(zhí)行更復(fù)雜的任務(wù),比如撞倒某個東西、往不同方向前進(jìn),甚至我們用自然語言能去控制它。不說這東西對Isaac之類有什么用,感覺于游戲3D角色的動作多樣化、自然流暢都有相當(dāng)?shù)膬r值(雖然可能這東西云端和本地算力需求也十分巨大),遠(yuǎn)比現(xiàn)在的游戲體驗(yàn)更好、更豐富。
DLSS 3和游戲AI的生態(tài)推進(jìn)
談游戲AI嘛,自然少不了DLSS——相比前面談到的內(nèi)容,DLSS對玩家可產(chǎn)生的直觀感受提升應(yīng)該是更為顯著的。大部分玩家對于DLSS 3應(yīng)當(dāng)都挺熟的了,這里不再細(xì)說其技術(shù)細(xì)節(jié)。
簡單來說,DLSS 3是在原本DLSS 2能夠做AI超分辨率的基礎(chǔ)上,加入了幀生成和Reflex低延遲技術(shù)。如文首所述,DLSS 3幀生成是通過AI生成的——它更像是image圖像領(lǐng)域的技術(shù),而非由graphic圖形計(jì)算獲得。
具體是怎么補(bǔ)的,可以參見我之前撰寫的文章,總結(jié)起來是運(yùn)動矢量+光流。GPU硬件層面,這代Ada Lovelace是加入了光流加速器的。另外,配套的Reflex通過抹去渲染隊(duì)列的延遲,不僅抵消了補(bǔ)幀在流程上增加的延遲,而且讓輸入到顯示設(shè)備響應(yīng)全鏈路的延遲降低到一個新的水平。
此前GTC上演示DLSS 3比較讓人印象深刻的是Racer X,GeForce RTX 4090 + DLSS 3相比RTX 3090 + DLSS 2,設(shè)計(jì)場景實(shí)現(xiàn)了將近4倍的幀數(shù)提升。DLSS 3的幀生成在其中是起到了相當(dāng)大的作用的。

這次品鑒會讓我印象比較深刻的一是跑Unreal Engine虛幻引擎的實(shí)時渲染官方demo,現(xiàn)場工作人員說當(dāng)場景變得非常復(fù)雜時,RTX 4090的實(shí)時渲染幀率也只有差不多20fps;引入DLSS 2做超分,則幀率能夠提升到接近30fps;而藉由DLSS 3補(bǔ)幀,畫面提升到接近60fps;
其二是NVIDIA與國內(nèi)的建筑軟件D5的合作,在D5加入DLSS 3支持以后,建筑場景實(shí)時渲染可以從30fps提升到60fps。這些對于創(chuàng)作者、設(shè)計(jì)師而言都是體驗(yàn)層面質(zhì)的提升。
之前總有部分游戲玩家說,AI生成的像素和幀“不算數(shù)”,渲染算力才是“真正的”算力。這話或許得分兩部分來看。其一是評價一個復(fù)雜系統(tǒng)的性能,應(yīng)當(dāng)以高抽象層級的性能表現(xiàn)為判斷依據(jù),而不是系統(tǒng)中的某一個組件。在游戲和設(shè)計(jì)類別的應(yīng)用里,所謂的“高抽象層級”就是玩家和用戶的體驗(yàn)。畫面好不好看、動起來流暢不流暢、綜合體驗(yàn)行不行是鐵一般的判斷標(biāo)準(zhǔn)。
實(shí)際上即便在傳統(tǒng)的圖形渲染管線里,也有各種諸如數(shù)據(jù)壓縮之類的奇技淫巧在發(fā)揮作用——這些取巧的技術(shù)算不算數(shù)呢?何況在圖形學(xué)生態(tài)變得復(fù)雜、多樣時,衡量一個系統(tǒng)的優(yōu)劣,早就脫離了FP32算力的范疇。圖形加速卡發(fā)展的歷史長河中誕生過很多不同的技術(shù),AI現(xiàn)在作為其中一環(huán),“怎么不算呢?”
另一個關(guān)鍵問題是,半導(dǎo)體行業(yè)的摩爾定律停滯。單純靠堆shader core和存儲資源,要達(dá)成品鑒會上Unreal Engine或者D5演示demo的60fps,現(xiàn)階段所需付出的代價恐怕是任何玩家、工作室,乃至HPC數(shù)據(jù)中心都無法承擔(dān)的;AI的誕生可以說是摩爾定律停滯時代的必然——因?yàn)檫@是系統(tǒng)層面提升面積與成本效益,外加能效的最佳選擇。
這里面最應(yīng)該擔(dān)心的應(yīng)該是DLSS的生態(tài)建設(shè)情況。因?yàn)橐獎佑肨ensor core加速,必然要求游戲和其他圖形應(yīng)用開發(fā)者在代碼層面做支持。如果這個生態(tài)吸引不到足夠多的開發(fā)者參與,那么Tensor core和AI技術(shù)才是白白浪費(fèi)了。

好在品鑒會上,NVIDIA說DLSS 3在推出半年內(nèi)的普及速度,相比于DLSS 2同期,已經(jīng)快了7倍。到目前為止,支持DLSS 的游戲已經(jīng)超過了300款,其中38款游戲和應(yīng)用現(xiàn)已支持DLSS 3。
品鑒會現(xiàn)場展示了不少支持DLSS 3的游戲,不僅是《賽博朋克2077》這類在光追特性上需要耗費(fèi)大量算力的3A游戲——尤其在overdrive超速模式誕生以后;還包括《暗黑破壞神IV》這樣的網(wǎng)游——DLSS能夠走進(jìn)網(wǎng)游,應(yīng)當(dāng)也某種程度表明了這項(xiàng)技術(shù)大眾化的開始。
現(xiàn)場工作人員說,《暗黑破壞神IV》1080p分辨率下,RTX 4060就能穩(wěn)定在100fps以上;而“有些玩家期望做到極致,開4K分辨率,那么有了DLSS 3,也能達(dá)到60fps”。這是GPU這種大芯片在即將突破reticle limit的時代,AI在體驗(yàn)層面實(shí)打?qū)嵉募映伞?/p>
其實(shí)這次NVIDIA期望展示的重點(diǎn),應(yīng)該在國產(chǎn)網(wǎng)游對DLSS 3的積極支持上,包括《永劫無間》《鳴潮》的PC端,是尚未公開、未來很快就要加入DLSS 3支持的demo演示;現(xiàn)場還有尚未上線的《重生邊緣》獨(dú)家Demo,對光線追蹤的完整支持引入,有了DLSS 3以后,RTX 4060玩2K分辨率也能有100+fps的幀率。
也有《無畏契約》這種追求低延遲,因此單獨(dú)加入Reflex的FPS游戲——現(xiàn)場工作人員告訴我們目前排名前10的FPS游戲,9款都已經(jīng)集成了Reflex。這些也都是NVIDIA圖形生態(tài)的組成部分。
摩爾定律死了,顯卡靠AI救贖
去年我們跟芯片行業(yè)內(nèi)的不少企業(yè)高層聊元宇宙,大家都認(rèn)同電子游戲就是元宇宙的某種雛形——玩家在里面消費(fèi)、交流、游覽…元宇宙作為虛擬世界,圖形構(gòu)建需要依托GPU——而元宇宙相比游戲會惠及更多人,GPU的市場還會有一次井噴。
也不光是元宇宙、電子游戲、專業(yè)視覺設(shè)計(jì),社會數(shù)字化轉(zhuǎn)型整體都對算力有著指數(shù)級增長的需求,則單靠摩爾定律支撐下GPU的圖形和通用計(jì)算單元頂著,是真的不夠看。何況摩爾定律還延續(xù)不下去了。
這時候我們看到,NVIDIA面向游戲在圖形卡上加入用于AI計(jì)算的Tensor core,為游戲布局DLSS 3、ACE等各種AI技術(shù)。大體思路就是圖形和AI一邊渲染、一邊生成像素,GeForce RTX 40系時代更像是未來世界的某種模板。GPU是在摩爾定律走不下去,單位面積再難成倍塞下晶體管時,獲得了AI的救贖的。
當(dāng)這種思路擴(kuò)展到更大范圍,不就是元宇宙和新時代的數(shù)字生活么?現(xiàn)階段還真的只有NVIDIA這一家做到了牢牢把持圖形與AI/HPC兩邊的生態(tài),并且雙方還正以相輔相成的姿態(tài)往前走。
