分類彙整: GPU

GTX280+(55nm GT200b)的spec?

http://nueda.main.jp/blog/archives/003690.html

55nmのGTX 280+ことGT200bのクロック

http://nueda.main.jp/blog/archives/003681.html

55nmのGTX 280はnVISION 08で発表

http://www.anandtech.com/video/showdoc.aspx?i=3354

ATI Radeon HD 4870 X2 – R700 Preview: AMD’s Fastest Single Card

Nvidia GT200b @ 648/1620 MHz? 1166 Gflops – VR-Zone Forum!

內容都在標題了。

原文是「shader時脈回到core的2.5x」。

也就是說乍看之下shader時脈上升到與G92/G94同等的程度;

不過TDP被估計與GTX280相同….真的假的?

另外一方面,4870X2畢竟是3.6GHz的1GB 256bit GDDR5放兩組(帳面數字230.4GB/s),頻寬上要對抗的話大概也得搬出GDDR5;

不過目前並沒有特別提及GT200b到底支不支援….

老實說,GeForce全換成GT200b、65nm的GT200全部到Tesla市場販售的話,實際獲利應該會提高,畢竟拿那麼大的晶片來做GeForce是賠錢貨….

高階graphict產品線整個都是宣傳成本的關係,如果目前能夠扳回一城的話那就是好事。當然能不能扳回來又是另一個問題了….

Larrabee一開始就是正統GPU?

http://pc.watch.impress.co.jp/docs/2008/0716/kaigai453.htm

Larrabeeに追われるNVIDIAがGT200に施したGPGPU向け拡張

 Intelは、じつはLarrabee戦略の当初から、グラフィックス製品として普及させる計画だった。つまり、グラフィックス製品へと戦略を切り替えたのではなく、当初からグラフィックスとして売る計画だった。しかし、GPUベンダーを警戒させないために、当初は、煙幕を張り、Larrabee はHPC向けと謳っていたという。このコーナーでも、IntelがLarrabeeの戦略を切り替えたように書いてきたが、それは、実際にはIntelの宣伝戦略に乗せられていたわけだ。

後藤老爹說他自己也被唬了,Larrabee並不是many-core,反而是一開始就是以GPU市場為目標的東西。

一開始說是HPC用途、架構學CELL之類的話,全部都是欺敵,單純只是為了避免反制的手段,Larrabee完全是GeForce的對抗產品。

所以Larrabee不該當成前往many-core的步驟,而是Intel承認GPU在PC架構內的地位,全力推出該領域重量級產品的象徵。

這樣一來的話GMA的小組應該未來還是會與Larrabee的team結合才是;類似CPU的cache系統則是GPU在stream out介面設計上的取捨,Larrabee必須要同時具備multi-core x86 CPU與GPU兩個領域的特徵。

如果是2009年要推出的正統GPU,那麼TMU和ROP不只要具備,而且很可能是full DX11 spec 等級的超大排場(當初文件即宣稱512bit GDDR5)。

理論數字2TFLOPS(DP? SP?)也顯然是shader only就已經有的性能,光論這點的話可以預想足足是G100的兩倍大,接近號稱2000sp(400shader?)的RV870(謠傳)。

而且Larrabee的微縮版(32nm)馬上就在後頭等著,也就是說,09年的時候單晶片Tera FLOPS的資源只怕會變成站上舞台的基本要求。

反正還有兩周左右就要公布底細了…. 如果Intel一開始就有決心做超高階GPU的產品,那麼橫在面前的問題就只剩下Driver quality如何追上了。

以過去GMA在OSS社群得到的資源來說,雖然堪用但是顯然不足以在遊戲市場上與對手爭一長短,還是得豁下去才行。

NVIDIA的目的是在Larrabee推出之前,奠定stream computing的標準地位,所以寧可透過支援社群讓Radeon具備CUDA的能力,讓brook+自然淘汰。

只要能跑的話,就有很大的機會影響OpenCL、建立de facto standard,並讓Larrabee也必須考慮CUDA type的support,NVIDIA才有機會繼續玩下去。

當然,從RV770和G92b的die size比較,也可以看得出疲態了就是….

—-

因為NVIDIA本周兩度瘋狂降價,廠商開始提供買貴退差價的服務….

http://www.evga.com/articles/evgabuckspromo.asp

http://www.xfxforce.com/en-us/Features/GTXCASHBACK.aspx?lang=en-us

可惜只限US。XDa

NVIDIA的股價繼續崩跌

目前股價失去理智中。不知怎的對NVIDIA沒信心到一種程度。

大概大家都覺得NVIDIA在兩個大廠中間撐到現在是奇蹟吧?然後泡沫快破滅了之類的。

真沒信心….

不過,Intel要不要趁現在趕快收購NVIDIA啊?XD

跌到七美元左右出手的話,要買下51%資本只要25億美金就可以搞定,比當初AMD買ATI值得多啦XD

well,我對NVIDIA目前的結構還很有信心的理由是GT200的一些設計:

http://pc.watch.impress.co.jp/docs/2008/0707/kaigai452.htm

GeForce GTX 200(GT200)のパフォーマンスの秘密

其實後藤老爹這篇說穿了,就是在設法替G100如何達成93%的dual-issue找理由….

說起來由於每個thread獨立,只要warp內可以找到8個同指令的thread配對,就可以一直維持高速,原理上完全不會有相依性的關係,實質上是終極的co-issue。

透過那個過去傳出的16thread”半warp”(後來就不再出現了)來推測「指令發射的half clock其實是對兩個unit交替發射」這點是蠻有趣的….不過這樣的話warp規模調整就一定是以32thread為單位了(因為實質上是8thread x 4cylce x N的方式來調整)

後藤老爹對dual-issue的推測有個問題的地方是,他把G80當成full scalar來設想,實際上應該不是full scalar,而是有gather & scatter功能的4D vector unit並列;於是8個unit共用的scalar DP,應該是2個1/2 cycle thoughtput的DP unit,但是其他部分其實還是大略吻合,這使得G100(GT200)有盡可能做到dual-issue。

總之G100的這些增加卻沒有很大的電晶體需求,比方說來點簡單的加減:

G92 — 754M

G94 — 505M

G94 x2 = 1010M = 8TPC、32ROP、512bit

 *: PCIe/display/raster重複計算

G92 – G94 = 4TPC(GT100) = 249M(GT100)

G94 x2 – 754M = 16ROP(GT100) = 256M

10TPC + 512bit = G92 x 2 – 6TPC (1134M) or G94x2 + 2TPC (同1134M)

G100 = 1400M = 10TPC(GT200) + 32ROP(GT200)

1400 – 1134M = 250M(GT200相對於GT100的擴增規模,10TPC + 32ROP的總計)

當然這些數字意義不大,因為都忽略了雙層crossbar和rasterizer logic,而且這部分其實非常龐大(從die photo就可以知道);

但是由於這些部份同時也都需要隨著TPC與ROP數量作線性放大的關係,所以都當成規模的一部分直接扣進去_A_

可以當個參考比例。

結論就是,可以推知GT200的每個TPC,(對整個晶片比例來說)只增加1/4以下的電晶體,便得到增加50%的ALU性能,而且還沒有把dual-issue帶來的改進考慮進去。

實際TPC數量減少(和相當於1500M的G92直接double比起來),帶來的就是Crossbar規模的縮減。

(*:上述的擴增其實都是有把crossbar規模考慮進去的關係,SP的電晶體數量其實應該真的有增加個40~50%)

而且由於整個register file都double,其實說起來GT200系列的shader multiprocessor應該可以容許全速的DP,這點也是G92直接double也做不到的….不過記憶體頻寬大概負荷不了的關係,意義不大。(和powerXcell 8i的道理相同,行銷意義大於實質性能意義)

當然也不可能一直以這種方法(增加TPC內部register file規模、縮減crossbar規模)做下去就是了….

—-

話說回來,Larrabee好像是4thread + 大規模的單一cache來處理(似乎不區分texture or constant),控制都交給軟體了。

這相對又是個大極端…….XDa

另外,前兩天的引用提到PureVideoHD(VP2)已經可以由CUDA存取了,叫做CUDA Video Decode API。

http://viml.nchc.org.tw/blog/paper_info.php?CLASS_ID=1&SUB_ID=1&PAPER_ID=70

GT200的倍精度性能

http://pc.watch.impress.co.jp/docs/2008/0620/kaigai449.htm

GeForce GTX 280の倍精度浮動小数点演算

倍精度方面提供的功能看起來盡可能塞滿了….不過不可忽略的是,畢竟還是只做1/8而已。

以ALU規模來說,倍精度會比單精度大一些,但是還是占SP總規模10%左右;反過來說,作全速的話就是SP會變成180%。

(還是沒有double就是了)

問題終究是在記憶體頻寬上,以實際運算能量約90GFLOPS來說,Tesla T10P提供了100GB/s的頻寬(以及4GB的容量),其實是有搭上去。

不過以倍精度性能和電晶體規模來說其實是不怎麼樣,混合精度是必要的。

只是CELL也做過這樣的東西(特殊版的Linpack),但是最後還是推出PowerXcell這樣的產品,也許某種意味上全速倍精度是一種宣傳用的東西。

G92超頻版緊急發表

http://pc.watch.impress.co.jp/docs/2008/0619/nvidia.htm

NVIDIA、229ドルのハイエンドGPU「GeForce 9800 GTX+」

~既存の9800 GTXは199ドルに値下げ

core 675 to 738、sp 1688 to 1836。

有趣的是PhsyX帶來3DV很大的分數提升,號稱UT3從30fps稍低,拉高到超過70fps。

現在G8x/G9x/GT200的問題是本來的single-issue SIMT自排列效率很高不需要什麼optimize,而dual-issue要發揮出來的話需要optimize。

剛好和R6x0的VLIW很需要optimize相反…. XD

—-

http://pc.watch.impress.co.jp/docs/2008/0619/kaigai448.htm

GT200コアでHPCの世界を狙う「Tesla」

基本上RMS(「Recognition」「Mining」「Synthesis(合成)」)構成的新界面是非常讓人有興趣的,GPU或者是其餘multi-core CPU solution的目的顯然都是朝這方向走。

總之能做的事情太多了,所以性能怎樣都不嫌多XD

Tesla T10P正式發表,單張4GB memory、1U server照樣放四張。這回1TFLOPS不是給GeForce而是給Tesla產品,也可以看出NVIDIA重視的方向。

—-

[EDIT]

http://www.pcper.com/comments.php?nid=5817

Yes, Virginia, this really is a 55nm NVIDIA GPU

還真的是55nm G92b O_o)a

die size大幅縮小到231mm^2,比324mm^2的G92縮小了約40%。

這肯定有縮別的東西了。

GT200相對於G80/G92的改善

http://pc.watch.impress.co.jp/docs/2008/0617/tawada143.htm

■多和田新也のニューアイテム診断室■

新設計コアを採用するNVIDIAの新ハイエンド「GeForce GTX 280」

http://pc.watch.impress.co.jp/docs/2008/0617/kaigai446.htm

後藤弘茂のWeekly海外ニュース

NVIDIAの1TFLOPS GPU「GeForce GTX 280」がついに登場

http://pc.watch.impress.co.jp/docs/2008/0617/nvidia.htm

NVIDIA、第2世代統合シェーダ搭載GPU「GeForce GTX 200」

—-

GT200代表的意味是”G8x/G9x = GT100″,or”GT = GeForce/Tesla”。

此外,G8x/G9x的missing MUL透過fw177找回來了….O_o

於是最近CUDA的文件又把G80寫回518GFLOPS;不過這似乎對CUDA的幫助比較大,對graphic就普通了。

GT200有改的部分應該只有:

1. TPC總thread數從1536變成3072

然後SM因為增加一個,所以每個SM可以分到的thread從768變成1024、亦即從24warp提高到32warp。

TMU相較於G8x/G9x沒有大變化。

GT200的材質處理是與G84開始的G8x/G9x一樣,有8個8bit Tex-fetch、8個FP32 Tex-Address。

所以GT200的TPC和G84一樣,相對於G80一樣都高了一倍的int8 (filtered)texture輸出。

而先前以為GT200是比G92少….所以這邊要更正一下_A_

另外要注意的是每個SM有一個1D FP64倍精度。

相較之下RV670是每個5D ALU有一個1D FP64,所以RV770的倍精度浮點能力就一口氣從64個變成160個FP64/cylce,大幅超過只有30個(不過還要再double clock)FP64 的GT200。

2. ROP blend速度強化

從2cycle變成1cycle的blending輸出,老實說這我覺得是繪圖面主要的強化。

—-

http://www.pcinlife.com/article/graphics/2008-06-16/1213601612d533.html

PCINLIFE的GT200 review。

65nm下仍然是24.5 x 24.5 mm^2的超級大晶片….讓人捏把冷汗。

只要應用程式本身使用的記憶體沒有超過GX2的512MB上限,由於比較高的Shader clock、比較多的TMU,9800GX2還是能取得一些優勢;如果超過的話GX2會急速變慢的關係,GTX280就會出現明顯的優勢。這會讓人覺得G92還是應該加點記憶體….

Crysis下GTX280單卡可以在1680×1050 veryHigh順暢運作,還離單卡HD的期望有點距離。XD

總之GT200代表的是fabless模式下,可以生產的經濟規模上限探頂。

如果NVIDIA可以透過這個模式獲利,未來也許會繼續嘗試這個規模的GPU;

反之AMD則是繼續走C/P值模式。RV770兩顆構成的R700看起來會有很不錯的表現?

GTX280/260 final spec

http://nueda.main.jp/blog/archives/003593.html

GeForce GTX 280/260の最終仕様

Geforce GTX 280 final specs – Fudzilla

Geforce GTX 260 final specs – Fudzilla

NVIDIA rumoured to drop price of GTX 260 to $399 to fight AMD Radeon HD 4870 – OCW

因為部分benchmark有輸,所以GTX260降價到399usd來與4870作短兵相接。

不過由於晶片成本相差蠻多的,所以某種意味上已經輸了一半。XD

GTX 280 :240sp(1296MHz)、602/2214(GDDR3)、1024MB、236W、$649

GTX 260 :192sp(1242MHz)、576/1998(GDDR3)、896MB、182W、$449→399

PCB差不多一樣,都能做3way-SLI。

GTX280外觀圖

http://www.vr-zone.com/articles/Detailed_Geforce_GTX_280_Pictures/5826.html

Detailed Geforce GTX 280 Pictures

不過PCB是綠色的…. 這代表GTX280往上還有更高的產品線?

http://forums.vr-zone.com/showthread.php?t=283808

idle 25w、BD playing 32w、3DMark06 147w。

同狀況下的9800GTX是45/50/80w,所以即使製程相同,GTX280也花了不少功夫(比以前多)來做降低耗電….

25w idle算是已經和9600GT差不多了;不過還是ATI同級產品(3870)的兩倍就是。XD

—-

http://www.tomshardware.tw/550,news-550.html

G92 9800GTX在3DV的得分稍微低於4850….而且是Performance的差距比Extreme小。

TMU和ROP double確實讓RV770的性能改善很多,所以G92b如果沒有改良的話,第三季的中階對抗會比較辛苦。

GeForce GTX 200 系列詳細規格

http://www.theinquirer.net/gb/inquirer/news/2008/05/24/gtx260-280-revealed

Nvidia GTX260 and 280 revealed

Editor’s Day的資料直接爆出來:

die size 576mm^2、TSMC 65nm

GTX280

240sp 32ROP 933GFLOPS(*)

1296MHz(shader) 602MHz(core) 1107MHz(Memory)

512bit GDDR3 1GB

TDP 236w MAX

600+ usd

GTX260

192sp 28ROP

999MHz(shader) 576MHz(core) 896MHz(Memory)

448bit GDDR3 896MB

TDP 182w MAX

449usd

(*):這數字應該是MAD+MUL…. 只算MAD的話應該只有622GFLOPS。

INQ是已經判死刑了啦XD….一副斷定ATI要大反攻的態勢XD

不過我對產品還沒有出,就已經在傳”更下一代產品(R870)”的狀態覺得有點淒慘就是。

不過GT200這規格的確是蠻讓人失望的就是了_A_

我一直以為933GFLOPS是MAD only,shader clock有1.9GHz前後;結果shader clock只有1.3GHz的話,那就沒得商量啦。

[EDIT]

http://www.youtube.com/user/leejik73

當日部分demo動畫。

找韓國人就會變成這種有點日系卻又不是日系的東西_A_

FAH for CUDA confirm

http://www.pcper.com/comments.php?nid=5679

Folding@Home NVIDIA GPU Client Confirmed

http://www.nordichardware.com/news,7777.html

GeForce GTX280 folds three times faster than Radeon HD 3870 – NordicHardware

話說要不是這篇,還不知道GeForce8系列已經賣70M個了….O_o)a

當然,平均100GFLOPS的話就是有把中低階算進去。

所以照這個數字的話,應該就是G84賣最多了。(32vs * 2FLOPS *1.35GHz = 86.4GFLOPS)



PS3 vs 3870 vs GeForce”NEXT”,這指的應該是GT200…每日500mol、高過PS3(100mol/day)和3870(170mol/day)不少。

3870在FAH執行上的C/P值(電晶體數量比例與效能)上不太妙,666M大了235M的CELL快2.8倍,記憶體頻寬的話3870也有2.25GHz 的GDDR3,72GB/s也差不多是CELL的三倍,實際性能只有1.7倍。

但是以這個觀點來說,GT200也只有和CELL同等的效率就是了….(電晶體成本和記憶體頻寬都差不多是CELL的五倍,和性能表現的比例相去不遠)

所以可以預期G84跑FAH的性能和CELL會差不多?

[EDIT]

http://www.legitreviews.com/article/713/1/

清晰照 + client screen shot

http://www.extremetech.com/article2/0,2845,2284132,00.asp

Folding@home GPU2 Client Examined

ExtremeTech: In the first GPU client, which worked through a DirectX interface, the types of work units that could be used were relatively limited. Now that DirectX is bypassed with the CAL driver for ATI cards, how have the work units been expanded? Is it comparable to the PS3 client in this regard?

Dr. Pande: Yes, going through CAL has helped a lot in several ways. The calculation is currently a superset of the PS3 1.31 client, but we hope to port some of the new code on GPU2 to the PS3 as well.

—-

http://pc.watch.impress.co.jp/docs/2008/0523/kaigai441.htm

Nehalemに見えるIntel CPUマイクロアーキテクチャの今後

本來Core MA的Loop Detector放在x86 Decoder前、現在Nehalem放在Decoder後。

雖然不是和trace cache一樣的發展方向,但是不同的出發點(Loop Detector)卻走到類似的方向,其實也蠻有趣的就是了。