http://pc.watch.impress.co.jp/docs/column/kaigai/20090923_317273.html
“デュアルコア”化によって2倍の性能になった「ATI Radeon HD 5800」
這就是雙rasterizer的理由嗎….
—–
http://www.4gamer.net/games/049/G004963/20090923003/
Intel,IDF 2009で「Larrabee」の実機デモを披露。
2010年以降,ハイエンド市場向けにグラフィックスカードを投入へ
他們老是在demo raytracer….
但是GPU受關切的大多是對同時期遊戲的相容性。
比方說這個demo是ETQW,但是說不定沒改過的原始ETQW連跑都跑不完。
http://pc.watch.impress.co.jp/…90924_317309.html
理由也許是這篇
如果按照770的樣式擴展,是一個20X8的Xbar,512sp的G300也就16X8的Xbar即可……
雖然是假設,但如果靠塞兩顆的話,則是兩個10X4的Xbar即可應付。
然后更下面的顯存是完美共享的。
按這種擴展法實現3200 512bit應該也不會有太大的困難,互聯復雜度是4個10X8的Xbar,僅僅相當于GT200已經實現過的,而ROP的數量可以達到恐怖的128個(每個64bit顯存控制器帶4組RBE,這4個RBE分別連接不同的4組simd core)
推測應該是為了適應NB市場已經取代桌機的趨勢,
為了數量不多的高階桌機新設計一個高階顯示核心
硬體研發成本不太划算.
以後ATI原生高階核心設計可能會消失吧.
高階=單晶片化的雙核心中階.
超高階=單卡化的雙高階晶片
這樣以後只要完成低階和中階核心設計即可.
如此一來硬體改朝換代的速度可以更快.
不過這表示以後中階卡和高階的SP數量會是1:2.
而不是以往的1:2.5 ?
> 推測應該是為了適應NB市場已經取代桌機的趨勢,
> 為了數量不多的高階桌機新設計一個高階顯示核心
> 硬體研發成本不太划算.
這讓我想到PowerVR SGX543mp….. 2~16core。
而且妙的是,數量不論奇偶數可以是2~16的任何一個數字。
> 按這種擴展法實現3200 512bit應該也不會有太大的困難,互聯復雜度是4個10X8的Xbar,僅僅相當于GT200已經實現過的,而ROP的數量可以達到恐怖的128個(每個64bit顯存控制器帶4組RBE,這4個RBE分別連接不同的4組simd core)
基本上其實就只是多一段crossbar….
只是分段位置和NVIDIA不一樣而已。
NVIDIA GT200是10x3x8,ATI RV870這回是2x10x16。
而這回GT300可能會是16x4x8。
其實好像基本上脫不了一個事實:16node的xbar大家都受不了了。
後藤老爹這篇出來以前我還以為搞定了20node的xbar,結果是2×10….
可能是Xbar要連的端點越多越遠,繞線距離會過長
而浪費電晶體. 如果不計代價倒也不是做不到,
但這樣會像當初R600的Ringbus一樣,
用了太多電晶體成本在與ALU計算能力無關的地方.
16node做出來反而競爭力不好.
16組以下也許是較合理的規模
下一代RV980應該就是4組10x16SIMD了.
其實我覺得有趣的是,16node的xbar是上限這點先前算是預測得到,但是極端說來GPU內部是multi-core這點還是沒有變,只是內部的interconnect成本越來越高。
不過相比之下Intel用的是multiple-ringbus….
所以隨著規模的擴大,犧牲加速比獲得更大的可擴展性變得更受青睞。
說到底還是高頻帶來的性能增長最可靠。
事實上考慮FGMT,高頻化的單元利用率也比較高啦….