黃仁勳談GF100

http://translate.google.com/translate?langpair=auto|en&u=http://www.golem.de/1009/78179.html
Jen-Hsun Huang in an interview “Fermi was at first completely broken”

所以fabric一開始就死了嗎….crossbar的限界?

——
AMD似乎繼續走簡化+搭數量的路, 把5D改成4D….然後堆大兩倍。
由於64pixel per wavefront,為了排程設計方便,應該會繼續維持array的單位數是倍數。
所以假設每個array還是一樣維持16個unit,以及BartXT謠傳有64TMU,
那麼4D * 16個unit * 總共8個array * 分成4個rasterizer,就可以兜出2048個SP和128TMU….
不過或許更單純點就是BartXT的兩倍(2560sp)吧。這樣array和TMU的關係就和以前不太一樣了。

其次是,實話是這看起來會贏GTX480一大截喔….

 

在〈黃仁勳談GF100〉中有 16 則留言

  1. 我是路人甲 (默)
    來自著名的強國情報基地 Chiphell 最新被默認的規格是:
    SIMD Array 的總 SP(ALU) 數量還是維持在 80,
    每個 SIMD Array 擁有 20 個 SP units (4D) 跟 4 TMUs。
    然後以一定數量的 SIMD Arrays 為一組,共用 8 ROPs 跟 UTDP 和 Setup Engine。
    Barts XT 擁有 16 SIMD Arrays,算起來就是 320×4 SP、8×4 ROPs 和 4×16 TMUs。
    Barts XT 擁有 14 SIMD Arrays,算起來就是 280×4 SP、8×4 ROPs 和 4×14 TMUs。
    Chiphell 那邊已經有人在質疑這個 20 SP Units 是想怎樣。

  2. to shady:
    不知道orz
    想想,論情報我只會比人家慢耶XDa
    to puff:
    不過20sp per Array真的很怪,怪到不行….因為wavefront的排程就卡在那邊,4/8/16/32都很容易,但是20塞到64就是塞不進去啊。
    反過來說,如果搞成320×4的話,繼續維持16個4D unit但是64個TMU相比之下變更似乎比較小;當然每個Array沒有連著一個quad的TMU仍然非常怪。
    960有關閉單元、或是1024sp的話則剛好會搭上64TMU、4D x 256 SIMD arrays、4D單元 + 64TMU的設計。
    當然有一個GF104的48sp這件事情發生過,倒是沒什麼不可能的_A_

  3. 反正5D變4D已經是全新架構…
    排程改成最小的branch size 80pixel
    per wavefront就解決了.
    雖然branch效能會下降,不過繪圖解析度拉高後,
    64和80其實沒有很大差異.

  4. 最小branch size應該只要是SIMD單位數的n倍數
    並且是4的倍數(1個Quad).就可以了.
    倒不一定要2^n. X1900的branch size就是48.
    ATI的branch size從16->48->64->…..
    似乎有慢慢變大的趨勢.
    黃仁勳似乎不認為GF100的Delay和晶片大小有關?
    而是團隊合作管理上的問題?
    而且28nm下一代要維持那樣的進步速度,晶片還是要很大…
    這…..恐怕28nm又要和良率拼了

  5. 實話是最小branch size 作太小也只是減低平行度虛耗成本、然後以前HPC的時代似乎有人提過64vector最有效率….
    但是GPU大概和這個數字無關了。

  6. 這次看來若其SP的數量有達到2048左右,
    GTX480就算有512 CUDA Core的數量也追不到…,
    更何況時脈拉也拉不上去…,
    只能說難追了~~!
    話說那個crossbar是拖累GTX480晚上市的原因嗎?
    還是現在的GTX480的crossbar是這一隻呢?

  7. 其實說「如此多」好像也普通而已,畢竟以SP數量為比例的話,它「只有」GT200的兩倍多10%….
    回過頭看GF104和GF106,和G92/GT200比起來就真的多了一截:
    G92 vs GF106 = 754M vs 1170M
    GT200 vs GF104 = 1400M vs 2000M
    雖說SP數量都多了50%,乍看之下好像也普通?
    register file也沒擴充….
    然後這邊就會讓人很好奇,雖然應該不會有所謂的「GF104 x2」的單晶片了。
    不過GT200 x2 vs GF104 x2 vs GF100的話,顯然毫無疑問地GF104 x2表現會最好。
    然後回到原題:GF100的問題和電晶體規模有關嗎?
    我覺得有,因為晶圓的random error機率會隨著面積擴大而飆高,但是crossbar應該不是電晶體「數量」的問題,而是wiring的問題。

  8. >>GF100的電晶體如此多也是crossbar的問題嗎?
    crossbar不好做是電晶體多的結果而非原因吧.
    雖SM已經模組化,但是要讓它們都能存取記憶體得靠
    crossbar,SM越多自然越難安排線路.
    GF100的電晶體如此多,只是因為NV要搞大晶片.
    本來就夠大了,每一代還都想double.
    它放了2倍於上一代的CUDA單位數…..
    要做16組SM這麼多的單位都能連到內存.
    ….才讓超大的crossbar難設計,
    若是小晶片就簡單多了,像是GF104只有8SM.
    如果一開始就做這個Size, fermi應該不會拖這麼久.

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

這個網站採用 Akismet 服務減少垃圾留言。進一步了解 Akismet 如何處理網站訪客的留言資料