http://translate.google.com/translate?langpair=auto|en&u=http://www.golem.de/1009/78179.html
Jen-Hsun Huang in an interview “Fermi was at first completely broken”
所以fabric一開始就死了嗎….crossbar的限界?
——
AMD似乎繼續走簡化+搭數量的路, 把5D改成4D….然後堆大兩倍。
由於64pixel per wavefront,為了排程設計方便,應該會繼續維持array的單位數是倍數。
所以假設每個array還是一樣維持16個unit,以及BartXT謠傳有64TMU,
那麼4D * 16個unit * 總共8個array * 分成4個rasterizer,就可以兜出2048個SP和128TMU….
不過或許更單純點就是BartXT的兩倍(2560sp)吧。這樣array和TMU的關係就和以前不太一樣了。
其次是,實話是這看起來會贏GTX480一大截喔….
請問Eji大,
到底單卡最高階型號是否為HD6970?
我是路人甲 (默)
來自著名的強國情報基地 Chiphell 最新被默認的規格是:
SIMD Array 的總 SP(ALU) 數量還是維持在 80,
每個 SIMD Array 擁有 20 個 SP units (4D) 跟 4 TMUs。
然後以一定數量的 SIMD Arrays 為一組,共用 8 ROPs 跟 UTDP 和 Setup Engine。
Barts XT 擁有 16 SIMD Arrays,算起來就是 320×4 SP、8×4 ROPs 和 4×16 TMUs。
Barts XT 擁有 14 SIMD Arrays,算起來就是 280×4 SP、8×4 ROPs 和 4×14 TMUs。
Chiphell 那邊已經有人在質疑這個 20 SP Units 是想怎樣。
14 SIMD Arrays 那個是 Barts Pro,手誤了 顆顆
to shady:
不知道orz
想想,論情報我只會比人家慢耶XDa
to puff:
不過20sp per Array真的很怪,怪到不行….因為wavefront的排程就卡在那邊,4/8/16/32都很容易,但是20塞到64就是塞不進去啊。
反過來說,如果搞成320×4的話,繼續維持16個4D unit但是64個TMU相比之下變更似乎比較小;當然每個Array沒有連著一個quad的TMU仍然非常怪。
960有關閉單元、或是1024sp的話則剛好會搭上64TMU、4D x 256 SIMD arrays、4D單元 + 64TMU的設計。
當然有一個GF104的48sp這件事情發生過,倒是沒什麼不可能的_A_
也許20 Arrays不是巧合
16 Arrays X 5D wide x 32bit = 2560bit
20 Arrays X 4D wide x 32bit = 2560bit
容量一樣就硬塞看看嗎….嘿。
反正5D變4D已經是全新架構…
排程改成最小的branch size 80pixel
per wavefront就解決了.
雖然branch效能會下降,不過繪圖解析度拉高後,
64和80其實沒有很大差異.
嘿,我以為2^n會比較好設計呢。
最小branch size應該只要是SIMD單位數的n倍數
並且是4的倍數(1個Quad).就可以了.
倒不一定要2^n. X1900的branch size就是48.
ATI的branch size從16->48->64->…..
似乎有慢慢變大的趨勢.
黃仁勳似乎不認為GF100的Delay和晶片大小有關?
而是團隊合作管理上的問題?
而且28nm下一代要維持那樣的進步速度,晶片還是要很大…
這…..恐怕28nm又要和良率拼了
實話是最小branch size 作太小也只是減低平行度虛耗成本、然後以前HPC的時代似乎有人提過64vector最有效率….
但是GPU大概和這個數字無關了。
實話是在crossbar這點掛掉已經足夠可以算到規模問題了….
這次看來若其SP的數量有達到2048左右,
GTX480就算有512 CUDA Core的數量也追不到…,
更何況時脈拉也拉不上去…,
只能說難追了~~!
話說那個crossbar是拖累GTX480晚上市的原因嗎?
還是現在的GTX480的crossbar是這一隻呢?
聽起來應該是「拖累GTX480上市的是Crossbar」問題。
所以GF100的電晶體如此多也是crossbar的問題嗎?
其實說「如此多」好像也普通而已,畢竟以SP數量為比例的話,它「只有」GT200的兩倍多10%….
回過頭看GF104和GF106,和G92/GT200比起來就真的多了一截:
G92 vs GF106 = 754M vs 1170M
GT200 vs GF104 = 1400M vs 2000M
雖說SP數量都多了50%,乍看之下好像也普通?
register file也沒擴充….
然後這邊就會讓人很好奇,雖然應該不會有所謂的「GF104 x2」的單晶片了。
不過GT200 x2 vs GF104 x2 vs GF100的話,顯然毫無疑問地GF104 x2表現會最好。
然後回到原題:GF100的問題和電晶體規模有關嗎?
我覺得有,因為晶圓的random error機率會隨著面積擴大而飆高,但是crossbar應該不是電晶體「數量」的問題,而是wiring的問題。
>>GF100的電晶體如此多也是crossbar的問題嗎?
crossbar不好做是電晶體多的結果而非原因吧.
雖SM已經模組化,但是要讓它們都能存取記憶體得靠
crossbar,SM越多自然越難安排線路.
GF100的電晶體如此多,只是因為NV要搞大晶片.
本來就夠大了,每一代還都想double.
它放了2倍於上一代的CUDA單位數…..
要做16組SM這麼多的單位都能連到內存.
….才讓超大的crossbar難設計,
若是小晶片就簡單多了,像是GF104只有8SM.
如果一開始就做這個Size, fermi應該不會拖這麼久.