分類彙整: GPU

8800GS

http://nueda.main.jp/blog/archives/003165.html
G92の最下位機種 GeForce 8800 GSは2月に発売か?

88GS使用G92、6TPC、192bit(12ROP?)、384MB、售價大約為149~179usd,幾乎是88GT 512的半價。
整體來說PCB與9600GT的設定相同,預計只提供給OEM;
但由於AIC有可能自行推出8800GS,總之在9600GT與8800GS推出後,8800GT 256MB應該不會存在太久。

實際上D9P/D9E也受到D8P影響很大,D9P應該是原生4TPC、256bit的設計,所以D9E的最大組態不會比D8E來得大。[EDIT:6TPC > 4TPC for D9P spec]
當然D8E本來就不至於使用到兩個完整的G92/D8P,原本就被預測是96SP/6TPC x 2的設計。

D9P的die size應該有辦法減小到G92/D8P的3/4左右,對成本的幫助應該很明顯,這也反映到價格帶定位上;不過9600本來就是用來取代8600系列,這個定價是一般期待中的定價。

8800GTS-512MB正式發表;Crysis Physics demo

使用G92的8800GTS 512MB版今天正式發表。

PCWatch:多和田新也のニューアイテム診断室 65nmプロセスコア搭載の”新”「GeForce 8800 GTS」
ITmedia+D:“G92″世代「GeForce 8800 GTS 512M」の微妙な立ち位置を探る
4gamer.net:
その実力はGTX級。G92コア採用の「GeForce 8800 GTS 512」レビューを掲載

雙層風扇的風扇直徑與G80用的相同,運作溫度是80度,實質上與G80的差距沒有想像中大,不過耗電量差比較多,自行修改的散熱機制看來是必須了。
88GTS的供電迴路部分果然補齊三相,在電源本身不再有限制的狀況下,即使與88GT使用同樣的記憶體,88GTS仍然好超很多(GZ剛拿到就有人超到800/200/2200以上),所以一如預期88GT實質上是限縮版,非公版88GT大概會做一些類似的處置。
大部分狀況下性能接近G80版8800GTX,不過記憶體容量吃緊的時候會被甩開,所以可以推估如果有256bit 1GB版,在高負荷狀況下的落差應該會改善
與G92版88GT的差距並不明顯,定價的漲幅比性能提高的比例來得高,光增加一個TPC性能相差很小,所以預設時脈也有差距(core/shader/mem = 650/1625/2000),加上電源迴路的限縮來隔離GT與GTS;但是因為88GT准許非公版設計,所以其實這是擺好看的。

參考:ASUS 8800GT 1GB
http://pc.watch.impress.co.jp/docs/2007/1207/asus.htm
http://pc.watch.impress.co.jp/docs/2007/1207/asus_02.jpg

—–
補充:幾段Crysis的物理模擬效果demo

這些應該都是GPU跑的….尤其是sys_physics_CPU的開關效果非常驚人,據稱用CPU的狀況下4GHz的Quad-Core也只能跑個3fps;不過物理行為的精確度有掉一些,看起來不太自然的狀況也增加。

根據過去NVIDIA的說法,物理模擬是長度在1000op以上的超長shader,但是看來並非分支吃重….也許G7x就可以跑得很好?

[EDIT]
http://japan.gamespot.com/news/story/0,3800076565,20350114,00.htm
底下jyuriko兄扔的SPE物理性能評價數據來源。

http://developer.nvidia.com/object/havok-fx-gdc-2006.html
NVIDIA在2006年三月發表的GPU Physics。

—–
[再補充]
http://www.musicvideos.idv.hk/Crysis–Mass-Physics__VaHS-y_mapQ.html

THESE ARE NOT IN GAME FRAMERATES!

Alot of people are opening Crysis, putting in the code and expecting physics to run smoothly like in the video, it won’t (unless you have such an uber beast but I don’t think a machine available now could do this amount of stuff at 30fps).

To see how I made the physics so smooth, look at the tutorial I made for making your own: http://forums.facepunchstudios.com/showthread.php?p=8179898 The song is “Aberdeen City – Pretty Pet” You can download the man made out of boxes from here: http://www.crymod.com/thread.php?threadid=10448 (XYZ) The command is for rendering a video with capture_frames, actual gameplay will be extremely low frames per second, capture_frames isn’t affected by low fps but the physics having their own framerate do.

The video isn’t about how good Crysis or Cryengine2 is but it was actually made simply because I liked the look of lots of boxes flying around and structures collapsing etcetera and thought other people might like to see this also.

Higher quality versions:

Stage6 (stream):
http://www.stage6.com/user/Neillithan/video/1911267/
(thanks to http://www.youtube.com/Neillithan for this)

Filefront (download):
http://files.filefront.com/Crysis+Mass+Physicswmv/;9176864;/fileinfo.html

Rapidshare (download):
http://rapidshare.com/files/80206218/Crysis_-_Mass_Physics.wmv.html

If you want to upload it elsewhere yourself, please inform me with a message so I can add the link to it here.

Due to popular demand, I’ll post my specs but they only really effect the very first clip showing sys_physics_CPU 1 and how many boxes total I can render, which unfortunately limited the last clip. So, my system specs are:

Intel Core 2 Duo 4300 (1.8GHz) processor, overclocked to 2.2GHz, 2GB 800MHz RAM, Nvidia 512mb 7900GS GPU (DX9).

I get a Windows Vista base score of 5.1, RAM and CPU being the 5.1, HDD transfer rate at 5.5 and GPU at 5.8 for gaming, 5.9 for Aero.

But system specs will only change the speed of capturing it if you were to do this, the rendered video will be at whatever framerate you set to record and playback at.

I used the very high settings tweak for DX9
http://files.filefront.com/Very+High+for+DX9+Tweak/;9184685;/fileinfo.html

Then some commands I used ontop of that for this were:

sys_physics_CPU 0
fixed_time_step 0.033333
e_particles 0 (all those particles when a box would collide with something killed my GPU)
r_motionblur 4 (need the very high tweak if on DX9)
r_useEdgeAA 2 (fake anti aliasing, blurs edges)
r_displayinfo 0 (get rid of the white text when in devmode/sandbox)
cl_hud 0 (gets rid of the HUD)
capture_frames 1 (to take a screenshot at every frame so you can add them all together to make a smooth motioned video).
e_view_dist_ratio 200 (only in the last clip as I only really needed it then, though it would’ve been nice if I knew about it before; it makes the distance at which objects stop becoming visible further)

The motion of the boxes was done by tornadoes made invisible due to particles being disabled. The settings where changed around though such as in some clips there was no rotation. But there was one clip that used a “GravityVolume” found in Misc in objects in the rollup bar. Yes, there is still some physics lag when sys_physics_CPU is set to 0, but it’s SOOOO much smoother than if set at 1 when there’s that many physical interactions going on and I think it’s an actual physics engine problem where they can lock when colliding, they can’t get past what’s infront of them rather than it actually lagging like when it’s set to 1. If there was nothing in the way of a moving object, it won’t lag on 0 but can on 1.

The last clip wasn’t anywhere near as massive as I wanted it to be, unfortunately my GPU couldn’t handle rendering all the boxes when I doubled the amount of what is shown in the video so I left it as that rather than trying to find an actual limit of what it could handle incase it needs power to render the motion blur and stuff. For more info, see the tutorial (first link in this description). I PANT3RA I approves of this video. I like the “Crysis Physics Porn” that’s a common title for this to be linked from, it reminds me of a stupid image I made once for the lulz: http://i18.photobucket.com/albums/b101/Martzno8/Crysisporn.jpg Eww, look at the ugly mountain in the background…

所以其實上面的demo並不是in game framerate…. 而Crysis的物理是自製,CPU only。

[後藤老爹]RV670的一些額外細節

http://pc.watch.impress.co.jp/docs/2007/1205/kaigai405.htm
2個のGPUダイを密接に連携させたデュアルダイGPUが次のステップ

根據ATI的說法,RV670不只是die size降到R600的50%,而且耗電量降到49%、漏電甚至低於40%的界限達到37%。
理論上80nm-> 55nm這樣的一代製程改變,電容量應該會減少70%、也就是說透過製程改善得到的耗電量改善應該會在70%前後;但是RV670降到了50%,所以多出來的耗電量降低應該來自漏電抑制。
從ATI公布的數字來說,RV670的漏電只有R600的約36~37%。也就是說我們如果假定R600的耗電有1/2是來自漏電的話,那麼總電容量減少到64%,加上漏電量減少到36%,就得到總耗電量約50%前後的數據。
也就是說,其實製程微縮的確只提供了70%前後的耗電改善,製程本身的漏電抑制改善了2/3左右,才是RV670相對於R600耗電量大幅改善的主因;當然上述的數據後藤老爹是任意假定的數據,但是一般的高階GPU普遍來說至少有1/3左右是漏電。

所以TSMC在製程上做了什麼?
以本文的說法,65nm的高性能製程CLN65HS實際上沒有提供,只提供了CLN65GP的省電/通用版製程,55nm也只提供了CLN55GP這一版。
而RV670使用的似乎是所謂的CLN55G+,是以CLN65GP為基礎,針對GPU特別調整過的製程。也就是說TSMC的製程調整路線整個高性能(=高耗電)製程、而朝向強化通用版的方向。
順道一提的是,ATI的65nm使用的是CLN65G+,所以其實製程本身並不是像型號表示的那樣「用了馬上就奏效」,而是過了半代製程的調整時間,才開始在漏電上得到改善的。

後面是延續前一篇R680雙GPU解釋的部分,提到GPU未來除了NUMA結構之外,還會朝提供更強大的context switch能力,以同時cover虛擬環境的方式來改善。

當然NUMA結構的話,連結GPU的界面很可能就得比CPU時使用的介面更大;而且由於跨PCB的NUMA介面仍然很困難,單PCB的NUMA就已經很了不起了….所以ATI或許只要著眼在MCM上提供高頻寬就可以了。在這種情況下,用原生的介面即可。ATI過去有C1上的GPU – eDRAM介面的經驗(據稱類似SRAM介面?),要實作應該不難。

至於context switch的話問題就很麻煩了….畢竟大部分CPU也都沒辦法直接執行多個context,而是以分時的方式執行的,所以GPU目前也走這個方向;而多核心化之後,單一GPU無法達成的同時多context執行,就可以透過分散到各個GPU的方式來提供。當然其實單純地說,就像上面NUMA的狀況一樣,只要跨PCB,能提供的頻寬有限會很多事情做起來都很困難。

從實務上來說,因為遇到的困難點差不多,照理說NVIDIA的多核心GPU結構應該也會有類似的設計才是;不過會不會直接做dual-die產品的話,還有待觀察。

不過後面有句話很有趣:講到NVIDIA會不會在下一代走多晶片的時候,出現了這樣的一句話。
少なくとも、次のハイエンドであるG97(GeForce 9800系)は、シングルダイだと言われている。
所以,高階已經知道叫做G97而且是single die?對應到新的命名規則的話,也就是G97=D9E?
(也許會重演G75的事情,當年是誰被抓包?)

總之如果是single die solution的話,要看到NVIDIA實作MCM上的低延遲高頻寬介面,可能還要等一段時間也說不定。

——
補上一點感想:

我覺得ATI開始按照自己的節奏出牌的說法是正確的,但是必須重視的一點是:AMD的節奏是”經濟性”,所以如果強調AMD繼續以自己的節奏來出牌的話,那實質上等於AMD對GPU高階市場的參與度大幅會降低。也就是說ATI的高階市場產品 = 中低階市場的聚合物;而非過去高階市場為主、中階為高階下放的設計。

從製程的觀點來說當然關管有關管的缺點:所謂的瑕疵基本上是機率問題,所以你仍然很可能損壞在沒有冗長性的部分。
而多晶片的話相對來說單一晶片良率會提高沒錯,但是你仍然會有I/O的overhead,嚴格說來我認為兩邊其實是相去不遠的。
也就是說,其實對高階產品本身而言,”總和die size”相同的狀況下,成本的差距應該是不大的,重點是高階下放做出來的中階,和集合多晶片構成高階的中階原生相比,後者應該成本會比較低一些。

也就是說問題回到遊戲高階市場的利潤來源了:到底是獨佔下高貴的真高階比較賺錢;還是主打C/P、競爭激烈的的中高階比較賺錢?
通常勝敗分出來的時候高階市場的佔有率勝負都蠻明顯的,所以我覺得高階是偏向獨佔,也就是winner takes all;但是無論高階勝負如何,performance這段,也就是中高階都會有行銷可以發揮的空間,一直都沒有哪邊徹底吃香過,所以競爭總是激烈。

在問題尚未明朗的現況下,NVIDIA和ATI似乎已經各有自己的方向與目標了,NVIDIA雖然有一些欺敵的小動作,問題是欺敵其實不是勝負真正的關鍵,關鍵還是在於貫徹他們路線的強大產品。
所以ATI跟或不跟,狀況都不會改變。

到底哪邊會比較有利潤,或許這問題只有等待時間來回答。

至於ATI的雙核R680應該不是NVIDIA的影響,因為2006年6月的時候後藤對Dave Orton的訪談可以看得出來,他們是有打算長期以multi-chip solution為主要的高階解決方案的。
也就是說AMD對ATI的作用來說,與其說是變換路線,不如說是”加速路線”,也就是AMD只有增加ATI的執行力而已;然後AMD是因為ATI的路線符合自己需求所以決定與ATI合併,從這點來說或許當初沒買NVIDIA是因為這點。

問題來了,AMD當初在檢討ATI營收利潤的時候曾經以提高營收效率為未來改進主軸,但是高階半放棄狀態、沒有400mm^2 單晶片、全以multi-chip solution為主要的生產對象,在高階市場的競爭力能夠維持嗎?
甚至反過來說,整個高階市場真的有值得競爭的利潤嗎?

AMD似乎決定以生產性為主要的武器,這是自有晶圓(IDM)的優勢、同時也可能是一種迷思;反之fabless亦然,fabless廠商主導GPU市場已經兩個世代,或許我們需要一點新的思維。
上面這兩段話其實訊息是一樣的:在利潤競爭激烈的現況來說,GPU市場已經和CPU市場一樣飽和,利潤也被壓縮到很低的境地。即使未來發展路途仍大,但是這可能是充滿荊棘的消耗戰之路。

此外,還有GPU市場利潤的重要性還有另外一個隱含的意義:CPU市場目前短期內對手強大的關係,GPU市場可以取得的利潤重要性就會提升。
或許對AMD而言,NVIDIA看起來還是比Intel要來得”比較好攻略”?

SLI在Linux下的性能

和春日兄在MSN上討論到SEGA Lindbergh用Linux當OS的事情,討論到Arcade系統可以靠NVIDIA SLI來提升性能的部分。
這是因為過去我印象中NVIDIA的Linux Driver性能大約只落後Windows約10%左右;
其實後來去找了一下,一段時間前就有人放了benchmark result,而且使用的還是最近的Driver(07/09/18的Driver),跑的則是Quake4、使用的硬體是兩張GeFoece 8600GT;但是性能卻很不理想。

測試者從頭到尾都固定於1680×1050的解析度,只調整AA與AF設定。

在沒有開AA ~ 2x AA的狀況下,不論是Windows或是Linux下,SLI都可以發揮明顯的加速效果,但是Linux只有Windows的75~80%左右性能。
但是4x AA + 2x AF的時候,Linux SLI就已經跑不贏Windows的單卡了。
隨著AA/AF比例的提升,Windows與Linux系統的差距就越來越大,不過考慮8x AA + 4x AF相對於16x AA的落差還比較大,AF似乎對Linux Driver下的性能傷害較大?

總之,如果以這些數字來看的話,至少已GeForce8而言,Linux底下的性能損失大到很難讓人去投資的地步。
也許GeForce7這方面的問題比較小….某種意味來說,ATI與NVIDIA之間的競爭確實地嚴重消耗了彼此的體力啊。

TWIMTBP的一些值得注意的數據

http://www.mobile01.com/topicdetail.php?f=298&t=439125&last=4044402
專訪Roy Taylor,NVIDIA遊戲合作計畫幕後揭秘 by G.F.

有不少有趣的數據:

1. 比較活躍的DX9-DX10 GeForce gamer有約 183M組。

2. 目前有60M的Vista售出、19%的NVIDIA Driver download為Vista版本,(NVIDIA認為)堪稱成長最快的Windows版本、以及成長最快的DX版本。

3. Crysis相對於Far Cry大約在content上成長兩倍(!!)。
Data大約從4GB 成長到 7GB、Texture從232MB成長到1GB、shader從50K成長到85K、模型複雜度從700K polygon成長到約1.5M~2M polygons、Draw calls從1000成長到3~4000左右。
使用到的功能有Motion blur、DoF、volumetric fog/smoke(clouds)、HDR+AA、instancing、soft shadows、Procedurak damage;沒有使用到Stream out。

4. Crysis加入TWIMTBP是在2006年5月,NVIDIA於2006年6月的時候提供G80樣品給Crytek。
所以等於加入TWIMTBP的話,就可能會有數名NVIDIA的engineer駐守在合作廠商的辦公室(Crytek的場合是1~4人),以確保遊戲在NVIDIA的硬體上可以得到性能上的改善。
(除非廠商拒絕、或者如id/Epic等本來就對GeForce瞭如指掌的廠商)
比方說,NVIDIA有一位工程師個人在Hellgate London中貢獻了超過一萬行的程式碼,但NVIDIA與廠商之間沒有任何金錢關係,僅保持互惠原則。
以總數來說,NVIDIA在TWIMTBP裡面,(包含驅動程式團隊)共有三百位工程師,相當於價值八千萬美金的投資。”比其他對手加起來還要多”。

這其實和XBOX360支援3rd party的方法也是一樣的…._A_

5. 雖然下列的是常識,但是可以再提出來講一遍:
「DX10能做到的,沒有任何一項是DX9做不到的,但需要非常非常強大的DX9硬體才行,所以理論上做的到,但實際上做不到。」
主要是因為一些overhead的問題。
比方說geometry instacing,由於DX10有texture array之類的補強部分,所以比較容易做出”大量的、但是每片都不太一樣的樹葉”,DX9的話就只能做出很多一樣的樹葉,要做出差異的話就得使用到dynamic resource使得性能大幅下降。
結果就變成要達到足夠的性能,很可能會使用到超過同等性能下DX10硬體規模的DX9硬體。(為了彌補性能下降的幅度,而使得規模相對膨脹)
而且大部分的遊戲實作都傾向DX9的engine上加上DX10的post-processing,這樣會讓負擔更大;為了發揮DX10的性能,其實”只支援”DX10是有必要的,但是這點很難,所以現在其實還不知道DX10實際上的性能可以如何。
(大家都知道,要達到這點唯一的方式就是DX10 for Windows XP….)

6. Havok因為已經被Intel買下,所以已經不是獨立的API….
相對之下Novodex(AGEIA)因為是免費的所以本來很受歡迎,但是它綁AGEIA PPU的關係,也算是專屬的非獨立標準。
(不過我記得AGEIA的API有software implement
、也有SPE implement,為什麼不能生個GPU implement?)

7. 其實NVIDIA的思考也針對玩家….這和console最近流行的casual game剛好相反。(畢竟game本身就是高度的內容集中市場)
這邊提出的數據有:Mercury統計,2004Q1~2007Q1大約有190M左右的DX9硬體,mainstream(199usd以下)底下ATI有51%、NVIDIA有49%;但是performance(199usd以上)的話ATI為10%,NVIDIA為90%。
另外是關於遊戲公司的心態,遊戲公司有developer和publisher兩種,前者希望做好遊戲、後者希望遊戲賣得好。
所以前者希望的是高相容性、這對後者來說也是有必要的;但是optimize則不在這兩者的選項內。
所以在NVIDIA的觀念裡,publisher並不會在乎A/N的平衡,他們比較在乎console/PC之間的平衡。(因為console通常投資比較容易回收)
而NVIDIA的說法是,沒有一家廠商會願意收錢然後搞小動作,大家本身都希望能夠維持公正,只是NVIDIA的合作提供的就是比較好的開發效率。

Keita Iida:我們在開發時就有密切的合作,但ATI直到遊戲快上市才知道它的存在,並不是我們把ATI排除在外,而是ATI對於遊戲熱情和投入是輸給NVIDIA的。

8. 從NVIDIA的觀點來說,他們希望的是PC市場有更多的遊戲內容,而不是單純的console to PC移植。
當然這其實也是因為PC GPU產品更新的頻率比console快得多(即使已經在變慢了),所以相對地對fabless IP廠來說利潤會比較高。
所以NVIDIA理所當然地會放比較多的資源在PC GPU市場,PS3這邊的支援就…..目前所知還蠻悲慘的。
至於高價化的PC硬體,NVIDIA的感覺是”反正還有人在買”,所以應該還不會太貴。

8800GT入手心得

今天和人家借的8800GT剛到,想拿來測一些有的沒的。

就像先前講的,長期以來我們都會對PS3到底用G7x還是G8x好有意見,支持的理由也有所不同;
不過有個不可改變的前提,就是PS3的成本設定上只能接受90nm下die size約為250mm^2前後的晶片,而且必須是現有結構,所以可用的選擇不是G71就是G84。

支持使用G84的理由不出幾點:
1. 對FP16等texture format比較好的支援
2. 整體來說較為改善的記憶體系統,如ROP具備較好的色彩壓縮能力(平均來說G8x的8x MSAA等於G7x的4x MSAA性能)、back face culling的改善
3. 因為各種色彩支援能力改善而得來的HDR適應能力較高

也就是「對GPU而言比較重要的TMU/ROP部分應該會是G8x比較強」的論點。
反對的理由則主要集中在shader的raw performance上,畢竟Unified Shader & DX10 support還是比較吃電晶體;
上述的hardwired unit較強的理由也是一樣,雖然功能面較為powerful,但是卻忽視了單一TMU/ROP相對的規模膨脹(和G71相比,G84只有16TMU/8ROP)。
雖說RSX因為外部的layout成本限制,也是只有24TMU和8ROP,所以主要的差異應該就會是24TMU vs 16TMU….
不過從88GT本身拿出64TMU這種豪華排場來說,NVIDIA本身的論點大家也應該可以理解才是。

所以嚴格說來,其實當這段時間169.xx在新遊戲上把GeForce7系列弱化了約30%的新聞出現的時候,這些爭論其實就已經可以打上休止符了。
雖然沒有詳細的數據來比較G8x與G7x的性能差異,不過這30%的當量應該有一定程度的參考作用:
如果沒有DX10功能造成的嚴重stall,在G7x能支援的範圍下,與同電晶體數量的G8x會發生的性能差距應該就是這個數字。
對PS3來說使用G8x唯一的好處,應該就只是「比較能夠適應XBOX360移植來的跨平台遊戲」而已。

所以說,現在拿到的8800GT,其實作用只有拿來跑タイムリップ比較爽而已。_A_

—-
另外幾個聽來的傳聞,請馬耳東風對待之。
1. G94 4TPC、192 or 256bit,實質上等於1/2的G80。看來NVIDIA也知道目前G92的記憶體頻寬是餵不飽TA的….
2. G96 2TPC、128bit,實質上等於G84的65nm。
3. 即使晶片上已經有G92的字樣,NVIDIA仍然堅稱沒有G92….所以G92 = D8p、G94 = D8m、G96 = D8v,大家配合一下(核爆)。

最後,G92第一個產品是關管版這點很有趣,想想最近R5x0/R6x0似乎都沒有拿出過所謂關管版來,過去這招屢試不爽,很多玩家其實也對這種版本情有獨鍾….但是AMD卻不太做興這一套?

8800GT正式發表

後藤弘茂のWeekly海外ニュース NVIDIAの「GeForce 8800 GT(G92)」と 次に控える64-bit GPUアーキテクチャ
ゲームによってはGTX並み! 衝撃の「GeForce 8800 GT」パフォーマンス速報 – 4Gamer.net
NVIDIA GeForce 8800 GT速報レビュー – PC Watch
これぞ真の”ド級”GPU──GeForce 8800 GTで「Crysis」ベンチマークを動かす – ITmedia +D
NVIDIA GeForce 8800 GTの全貌 – マイコミジャーナル

「ド級」「超ド級」と聞くと、強烈にパワフルな最強GPUを連想するかもしれないが、それは「ド級=ドレッドノート級」本来の意味でない。
“G92″は、まさに「ド級」なGPUなのだ。(by ITmedia +D)

Dreadnought(袖珍戰艦)真正的意味其實不是戰艦本身的強度,而是在於其對海戰的革命性。
畢竟戰力總是會隨著技術進步而新舊更迭,但是當時Dreadnought級推出的時候,因為其戰鬥效能而使得它的諸多設計特性立刻讓當代所有海權國家起而效法。
使得大艦巨砲主義發展到巔峰,一直持續到硫磺島海戰大和號沉沒為止。

在此時8800GT推出,幾乎完整再現當年GeForce4 Ti-4200與高階卡設置相仿、但是價格卻在sweet point的249usd,展現破表的性能價格比,並且使得目前市場上所有的低高階卡全部洗牌的意義。
8800GTS320 phase out,8800Ultra動搖….但是這當然是預先設計好的世代交替,長期醞釀下終於成熟的65nm製程讓G8x終於得到全面席捲市場的能力。

まさにTi4200-II。

當年GeForce3 vs Radeon 8500,在過渡到GeForce4時,NVIDIA選擇固守性能優勢、忽視Pixel Shader 1.4支援;現在GeForce8 vs Radeon HD2900,過渡到G92時,NVIDIA再度選擇忽視DX10.1支援,如果性能優勢仍然能夠確保的話….

歴史は繰り返す。

———-
不過,當年Radeon 8500和 GeForce4的die size差不多,但是G92大了RV670接近1/3(50%)….
所以只要AMD肯狠下心來把RV670當成次階卡猛灑的話,還是會有所斬獲的。
反過來說,從關掉一個TPC就可以知道,G92這回是非常狠的戰略價格設定,必然有「損敵一千、自損八百」的狀況存在。

此外,就像4gamer.net所提。

この発表をそのまま受け取る業界関係者はほとんどおらず,「GeForce 8800 GTの3Dコアは,実のところGeForce 8800 GTX/Ultraとまったく同じ。”65nmプロセス版GeForce 8800 GTX/Ultra”を,歩留まり向上のため,1シェーダクラスタと2ROPブロックを無効化したバージョンである可能性が高い」という見方が有力だ。

雖然我個人對ROP保留有疑問,不過大幅增加的電晶體仍然有辦法解消這個疑問。就像過去G86一樣,外部用封裝來來截斷ROP與記憶體控制器已經有前例了,而且時間點算是非常近,還是相同結構的姊妹產品,所以384bit、128sp/8TPC全開的D8p/G92存在的可能性仍高,畢竟384bit是用來彌補記憶體系統成長速度所設計的,如果記憶體系統已經有提升的話那可以改回256bit。(不過NVIDIA的目標應該是GDDR5….?)

而且即使如此,與D8E/G92GX2的計畫仍然是不相衝突的。

此外,G9x這個編號被NVIDIA否定的關係,或許有可能NVIDIA決定把這個系列編號留給DX10.1/DX11的產品也說不定;當然短期內4TPC/6TPC產品的衍生應該還是會以G9x稱呼就是。

GeForce8續報3

http://www.mobile01.com/topicdetail.php?f=298&t=413501&last=3742976

因為8800GT目前的設定(G92/D8p、6TPC or 96sp、256bit、1800MHz、256 or 512MB)非常可能因為廠商推出超頻版而超過8800GTS-640的性能,所以產品區隔策略改變,NVIDIA偷偷把8800GTS-640從6TPC改為7TPC(112sp)的規格。
而8800GT基本上就是8800GTS-320原來的定位….只是現在出現一個問題:

NVIDIA will NOT be doing any formal launch activities, press announcements, website updates, or any other marketing around this new sku. Partners can conduct their own marketing activities around the sku as they see fit.

所以市場上可能會出現兩種88GTS640的產品但是性能不同,混淆視聽….
不過我是覺得到時候裡面的G80偷偷變成384bit封裝的G92/D8p就更爆笑了。(畢竟用兩個晶片cover四個產品線是很可怕的事情)

8800GT和新版的8800GTS 640將提早上市,原定11/12,現在提早到10/29上市!沒錯,這個月就要開始DX10「真.中階卡」的戰爭了。
(by G.F)

[EDIT]
http://www.mobile01.com/topicdetail.php?f=298&t=417148&last=3785774

GeForce 8800 GT會有112個SP
.SP時脈達1.5GHz
.記憶體時脈900MHz(有效1.8GHz)

取得第一份有載明D8p具有7TPC以上單元、與每TPC具備完整16SP的確認資料文件。
所以D8p確認是完全具備直接取代G80能力的晶片,這點也與RV670同等….

就看到時公布的die size和電晶體量多少了。

[EDIT2]
http://we.pcinlife.com/thread-830762-1-1.html


G92全線取代….

http://www.theinquirer.net/gb/inquirer/news/2007/10/10/nvidia-g92-little-g80-65nm
INQ表示G92的die size為17×17 289mm^2….
RV670先前聽說是196mm^2,應該是65nm與55nm的差異。
比例放大的話接近先前G80和R600之間的比例。

GeForce8續報2

Nvidia G92 is GeForce 8700 GTS(VR-Zone)
根據這篇的說法,單晶片的時候是65nm、256bit、512MB GDDR3、8層PCB。

Salty specs of G92 and G98 hit the web(TechConnect Magazine)
G98與G86一樣規模為1TPC、封裝為64bit;另外,G84 65nm版本維持編號。

現在的問題就是G92單晶片本身的規模了,這關係到G92 MCM(or single die dual-core)的成本問題….聽說如果G80還撐得住,高階有可能繼續讓G80挑大梁。

[EDIT]
由於有7TPC的規格出現,看來G92似乎與G80一樣都是8TPC的規模?

另外,die size方面大約知道與G71類似,所以NVIDIA目前看來打算重複7950GX2的產品策略,也就是沒有MCM而是雙晶片+雙PCB。

這樣最大的缺點自然是難以避免地會有SLI失效時單卡性能下降的問題….優點則是沿用設計設計所帶來的成本改善;為了彌補這點,會不會有類似現有G80高階定位的D8p單晶片產品(256bit以上)則是另一個問題。

GameTomorrow的CELL vs G80

http://gametomorrow.com/blog/index.php/2007/09/05/cell-vs-g80/
well,IBM又拿他們的iRT來說嘴了XD
能不能拿些別的應用出來….XD

這篇是引用薩爾大學的 Philipp Slusallek教授拿G80作ray-tracing的論文,Stackless KD-Tree Traversal for High Performance GPU Ray Tracing的數據,與CELL跑iRT的比較。非常有趣的是,iRT的作者正好是 Philipp Slusallek的學生。

這完全就是重複當初RacingPHT兄自己做的Ray-Tracing demo on G80的狀況,只是當初是預估,這次是實際跑完。

從左至右:

2.6 GHz AMD Opteron – Saarland Ray-tracer
Nvidia GeForce 8800 GTX – Saarland Ray-tracer
Sony Playstation3 (partial 3.2 GHz Cell processor running Linux) – IBM iRT
3.2 GHz Cell ProcessorIBM iRT
IBM QS20 Blade (Two 3.2 GHz Cell Processors) – IBM iRT

論文本身有提到因為Register footprint的關係,G80運作的效率並不高,有待CUDA本身的改善。

Although we believe a performance of over 16M rays/s to be already quite impressive for the CONFERENCE scene, we expected much higher performance: The G80 with its 128 scalar arithmetic units running at 1.3GHz should deliver over 160GFlops, meaning that tracing one ray costs about 10,000 cycles. We suspect the main bottleneck to be the large number of registers in the compiled code, which limits the occupancy of the GPU to less than 33%. Unfortunately, although the program requires much less registers, the CUDA compiler is not yet mature enough and cannot aid in reducing their count. An option would be to rewrite the whole CUDA code in PTX intermediate assembly.

16M rays/sec,考慮他們用的主要是scalar unit,至少應該有160GFLOPS,等於每個ray要跑10000cycles!不過即使是考慮33%的效率,仍與6SPE的CELL有相當的距離,更別提完整8SPE的CELL與內建雙CELL的QS20 blade,這應該與每個SPE都具備相對多數的register有關….然後IBM的人對Larrabee放話了。XD

iRT ray tracer已經於9/5開放下載。
http://gametomorrow.com/blog/index.php/2007/09/05/interactive-ray-tracer-irt-available-for-download/

下載位址為
http://www.alphaworks.ibm.com/tech/irt

內含有兩個demo scene,各為33萬3千個三角形的法拉利、以及六萬九千個三角形的史丹福兔寶寶。


在這兩個scene底下,PS3可以達到720p解析度下超過40fps。
PS3有6SPE、QS20有16個SPE之故,效能與SPE數量成線性關係,後者能達前者的2.5倍性能。

—-
說真的,來點別的應用吧。TGS07希望多點東西….
謠傳TGS07會有HOME for JP、firmware 2.0、新的線上AV服務、新定價策略與同捆包,甚至是FF7….