後藤老爹的Fermi專題第四篇

前三篇:

http://pc.watch.impress.co.jp/docs/column/kaigai/20091001_318463.html

NVIDIAが次世代GPUアーキテクチャ「Fermi」を発表

http://pc.watch.impress.co.jp/docs/column/kaigai/20091023_323529.html

NVIDIAが目指す究極のプロセッサへと進む「Fermi」アーキテクチャ

http://pc.watch.impress.co.jp/docs/column/kaigai/20091102_325517.html

フラットで自由度が高いNVIDIA Fermiのアーキテクチャ

—-

http://pc.watch.impress.co.jp/docs/column/kaigai/20091105_326442.html

NVIDIA Fermiのマルチスレッディングアーキテクチャ

「こうしたFermiアーキテクチャは、伝統的なグラフィックスのようにデータをストリームで処理してメモリにはき出すアーキテクチャでは、有利とは言えない。伝統的なグラフィックスパイプの効率だけを考えるなら、シェアードメモリとL1/L2キャッシュに増やした分のSRAMをレジスタに割り当てて、マルチスレッディングで立ち上げられるWarp数を増やした方が有効なケースが多いと予想されるからだ。例えば、レジスタを3.7MBに増やして、立ち上げられるWarp数の上限を2,000程度にすれば、その方が旧来のグラフィックスパイプでは高速になった可能性がある。

 しかし、そのアプローチを続けても、レジスタ使用量の多い汎用アプリケーションでの性能を上げ続けるのが難しいのも確かだ。プロセス技術の進化とともにコンピューティング性能を上げて行くGPUにとって、相対的に低速なオフチップメモリへのアクセスは今後も最大のボトルネックとなる。それを吸収するには、メモリ階層を深くする方が得策とNVIDIAは判断したようだ。 」

從過去的觀點來說,繼續擴張記憶體延遲隱蔽能力,可以有效提高shader的效率,維持shader unit的滿載,但是從通用運算面來說,透過register資源的擴充已經不見得能夠帶來更高的性能改善,所以NVIDIA不再增加分配大量的register給shader,而是把記憶體階層給改善。

Fermi的cache、share memory整體的規模,其實算起來相當逼近register file的規模,和過去G80/GT200比起來,算是兩邊有一定程度的平衡。所以如果GT200是G80路線的最終強化的話,Fermi就是G80/GT200路線的反思與改善,並且重新出發。

—-

話說有個題外話,register資源相對充裕的GT200,光從記憶體延遲的角度來看可能比Fermi更適合搭配延遲更大的記憶體系統也說不定,因為從單元數量來看的話,Fermi的記憶體延遲隱蔽能力回到G80程度,在非shader code之類的程式碼為主的狀態下因為有cache所以問題應該不大,不過純論shader code的話,新的記憶體階層好像就幫不太上忙….

不過要說這是放棄繪圖的話個人是保留態度,其實想想GPU的killer application終究還是繪圖,在HPC市場裡面殺手級應用目前看來還是visual computing,遊戲面也相信慢慢DirectComputing的應用會開始抬頭…. 所以或許應該說「繪圖不再只有shader code需要加速」也說不定。

不過反過來說,單純的現有繪圖code、也就是現存的遊戲性能到底會怎樣,就變成一個很讓人關注的話題。

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

這個網站採用 Akismet 服務減少垃圾留言。進一步了解 Akismet 如何處理網站訪客的留言資料