分類彙整: Uncategorized

君子報仇三年不晚 ~ 論NVIDIA在HDR上的行銷手法~

NVIDIA在六月推出G70之後,在九月初開始以"The Power of 3"等標語來強力行銷,同步推出7800GT。

當時本來預期NVIDIA會推出全系列的中階產品,看到7800GT時的感覺是有點失望…. 但是等到11月初6800GS、6600 DDR2推出之後,現在回頭看起來,才真的發覺到這是個相當高明的整體行銷策略。

討論:
https://www.kimicat.com/phpBB2/viewtopic.php?t=829 

先前在這裡提到了R580的結構,是16-1-3-2、也就是48組pixel shader、共計48個main32、48個mini32的超大型單元;但是TMU沒有FP filtering、也沒有Free FP16 Normalize。

本 來這不是個很大的問題,而且固定效能於這兩個用途上,感覺上也相當浪費,而且R520也提出了Int10/16混合精確度、3Dc+ single component Texture compression等功能來輔助HDR的使用,並且提出了HDR下的FSAA功能;只是前述的功能其實都不是針對OpenEXR FP16 HDR來設計的。

於是,如果論執行資源的話,這邊雖然算得有點籠統,不過如果假設以每個ROP前端分配到的Pixel Shader資源來說的話,這邊比較一下G70、R520與R580間的規模:

G70:1.5個TMU、1.5個PS(3個ALU)、TMU有FP filtering & Free nrm_pp
R520:1個TMU、1個PS(2個ALU)、FP filtering 與 Normalize由Pixel Shader處理。
R580:1個TMU、3個PS(6個ALU)、FP filtering 與 Normalize由Pixel Shader處理。

所以,這邊有個假設是:如果這新增的4個ALU,不能抵過 FP filtering 所需的執行資源的話,就會變成是NVIDIA的平行度較高了。
而且G70相對於NV40的一個很重大的改進,就是FP filtering的速度變快了:原本的FP filtering可能只有half speed。

如此一來,NVIDIA強推HDR的理由也變得相當明顯了:他們的結構針對這點擴增了執行資源,並且增加了免費的指令。
R580 本來擴增ALU資源的理由,是為了"不限制於單一的用途",但是當這個單一的用途成為主流、而變得長時間要被吃掉這些資源的時候,R580的規模優勢便會 遭到抵銷;而規模較小的G70在改為90nm的G71之後,很可能會進一步再抵消R580的時脈優勢,整體的執行資源便會出現此消彼長的狀況。

也就是說,今天不使用HDR的3DMark05雖然很可能會是R580以R520約1.5倍以上的表現,對G70取得優勢,但是3DMark06由於確定使用FP16 HDR,那麼R580擴增的ALU資源被消耗掉的機會也因此大增,分數上的差異便有可能縮小。

而 且,R580由於擴增了ALU數量,但"應該"沒有擴增Dispatch Processor的threading管制能力(為了節約die size),使得R520原本有的Branch penlty容忍能力,在R580的時候降低,這對疑似由Driver管理Dynamic Branch的G7x來說,也會從不力轉為有利。

於是結論是,由於G7x比R5x0早推出,影響了遊戲界的風向,使得G7x的架構較受遊戲 界歡迎,逼使R5x0本來的結構設計上的考量平衡受到了衝擊。G71便能以少了約30%的電晶體規模與die size,與ATI規模較大的同級產品在平行度上抗衡,進而在成本與產量上取得優勢。

其餘同理可證:6600 DDR2、6800GS,與原有的6600GT和7800GT/GTX等產品線,相對於ATI的產品通通構成了高低夾殺的陣勢,ATI打不到本來想打的 人,NVIDIA則可以順便銷庫存,等待明年推出G7x的中低階產品,好整以暇,全因HDR主流化之後成為優勢,當然不必貿然將舊產品phase out。

這個狀況一如當初NV3x與R3x0間的關係:NV3x本來不認為SM2會很快普及,做了一個SM1較好、SM2稍弱的結構,而較早推出的R3x0使得SM2較快普及,打破了NV3x原先的預想,進而陷入了長久的苦戰。

ATI當然會對即將推出的R580有著很深切的期許,R580也確實有著相當可觀的執行資源;不過面對市場的劣勢,有些事情並不見得能盡如人意,想想這個狀況也和當年的NV35是很類似的。

話說,如果光比GPGPU的話,可能R580就能摧枯拉朽吧?
雖然我覺得就算是GPGPU這個用途本身,也可能會隨著Cell的推廣而慢慢衰微也說不定。

—-
這一點可以告訴我們Time-to-Market的重要性。
目前已知有可能G80會緊接在G71後於2006年Q2推出,支援Shader Model 4.0 與 DX10,這時候NVIDIA的結構特性便可能會繼續影響SM3後的遊戲界風向,使得ATI的R6x0可能被迫要做出其他的妥協,而繼續陷入被動。

回頭看HDR…. 其實為了NVIDIA的這個策略,所謂的HDR已經陷入一種極為浮濫的狀況。

gloom-like HDR滿天飛,明明其實並不是SM3的一部份,卻被扭曲為SM3的標竿技術(其實本來應該是R520主打的 Dynamic branch),其實說起來,HDR的某些關鍵(曝光控制),在這些主打HDR的遊戲裡面反而遍尋不獲,本來HDRI主要的目的是要模擬Full Environment Lighting的,結果現在全部都拿來做dazzling….這真的不是一個很好的情形。

只是,遊戲市場畢 竟還是江山代有才人出,引領風騷數十載….Garbage-title終究是會有的,不見得NVIDIA不這麼做就會減少。想當初ATI也推了個讓人 頭痛的半調子精確度(FP24),結果也是把FP16/32混合經度給踹開了。既然現在市場上都能扶正為FP32,揚棄FP24可能造成的問題,我想 HDR浮濫的情況也慢慢會隨著美工技術know-how的累積,而得到改善吧。

從2002年底R300推出,到現在2005年底快要過完 了,半年前推出的G70在有足夠記憶體的頻寬下,面對晚半年推出的對手,仍然能維持性能優勢,整整三年的時間,目前看來NVIDIA有機會將NV3x時遇 到的狀況連本帶利地還給ATI,而且手法類似過去ATI的作法,真是君子報仇三年不晚啊。

—-
EDIT:
X-bit的測試測了Far Cry的HDR開關差異。
馬上印證了上面的想法…. (w
http://www.xbitlabs.com/articles/video/display/geforce7800gtx512.html

而且照理來說,目前這些程式通通都還沒有實裝FP Filtering Shader,只能考慮未來效能下降還會更明顯。
下面的這兩張圖來自HardOCP,不過這是Cho過去貼在B3D的圖,只是被HardOCP拿去用了。

原始出處:http://www.beyond3d.com/forum/showthread.php?t=25111

HardOCP盜圖處:http://www.hardocp.com/images/articles/1130724723wQf6EywE1q_5_5_l.jpg
http://www.hardocp.com/images/articles/1130724723wQf6EywE1q_5_6_l.jpg

總之,風水輪流轉了…. XD

Google 流量分析統計服務

Google Analytics
http://www.google.com/analytics/

Freeleaf作了一些解釋:
http://www.leafportal.org/MT/archives/001552.html 

每個網頁都要加那段….看起來好煩…._A_

phpBB的話,只需要在/includes/page_header.php裡面加上統計需要的script。

plog的話,lsss大寫了個plug-in支援。
http://blog.nlhs.tyc.edu.tw/post/2/55
裡面也放了不少設定上的心得,應該很有參考的價值。

靜態網頁的話…. (汗)

GTX 512正式發表;SLI動態切換 @ FW80

AnandTech的專題
GTX 512用更好的記憶體頻寬與核心時脈直接扳回一城,
不過要應對更大的威脅的話,G70需要更高的時脈….

於是馬路消息。
依ghrs2010的說法,同樣是TSMC 90nm,G71的第一個TDP折點在850MHz左右….orz
相較之下,R520的TDP折點分別在726、802、819,而且後續沒測試的關係可能還很多。
到底該說NVIDIA的佈局出神入化,還是ATI佈局荒腔走板?
看來這回R5x0問題這麼多,都是ATI自己的錯了?!

補充:小月說G71其實是"沒有TDP折點的",
也就是說IBM的佈局已經做到到critical-path之前完全是平順增溫, 達到理想化的佈局了嗎?(抖抖抖抖抖)

—–
話說回來,這下我真的想敗SLI了。

免開機動態切換!!!!!!

6600GT SLI、A8N-SLI Premium、FW81.85。
免重新開機,直接動態切換。
可以從兩張卡中任選一張的任何一個連接埠當輸出。

雖然一點都不起眼,但我覺得這是SLI最重大的突破。
這下我真的想敗了。

事情不妙….

收到一些怪消息,看起來GTX 512 和 6800GS一樣,都是出來頂這季而已的玩意兒。
而NVIDIA後頭還有怪東西要推….

你們到底還有多少暗樁啊。(汗) 

R580 是 16-1-3-2(1TMU/3ALU/2 Z)的這個spec,目前已經傳到其他地方來了,看來DaveB真的和ATI現在非常親近。XD
應該可以推論他老人家說的RV560(8-1-3-2)應該也是正確的。

目前得知R580的die size是352mm2,以這個數據來算的話,電晶體數量可能只有400M左右。

為什麼R580追加了這麼多的ALU,卻只有這麼小數量的電晶體增加呢?
我會認為這和dispatch processor的結構有很大的關係,這點可以參考RV530的架構圖:

R520 — 4個dispatch processor、4個TMU core(quad)、4個Pixel shader core(quad)
RV530 — 1個dispatch processor、1個TMU core(quad)、3個Pixel shader core(quad)

於是這樣就可以看得出來,16-1-3-2的R580,基本上是4個dispatch processor但是底下擴張到3個quad ALU的擴產性結構,也就是說dispatch processor其實很可能佔掉比ALU更大上許多的電晶體數量。

進一步的討論列於
http://www.lovehinaplus.com/phpBB2/viewtopic.php?p=45054#45054
http://www.lovehinaplus.com/phpBB2/viewtopic.php?p=45055#45055

—-
狀況或許這麼說比較單純:

R580應該是因為要跨到R600(DX10)還要相當長的時間,所以作一個超大版本來頂的;所以如果把R520->R580的過程,看成NVIDIA這邊從NV40 –> G70的過程的話,其實事情的經過就比較合理了。

反過來說,既然已經跨到G70這一步的NVIDIA,下一步看來當然就是自己的DX10 device,也就是NV50/G80了。

綜合INQ的G71 = RSX與G71 = 90nm G70這兩個說法來看,G71應該比G70更接近RSX、是G70的部份修改版;並且很可能跑相當高的時脈,推出的時間應該與G72/G73相仿。

但是接下來,應該就不是所謂的"32pipe G7x",而是直接推出G80了。(!!)
這也符合先前ASUS的人員講的"那玩意兒是NV50/G80"這個說法,畢竟32ps G7x是這邊自己下的某種猜想,實際上那顆420M的GPU其實根本沒人說過那是G7x。

說起來這和"32管的R520"的事情很像,實際上ASUS的人和小月都看不太得到非常完整的產品spec,只看得到特定的技術範疇…. 而且,實際上他們也不需要在意這點,只有受到marketing起舞的end user才會關心這些"字面上的東西"。

—-
G71可以用G70同等的設計(如PCB & TDP)直接上,所以ASUS想搞的dual-core產品也直接相容。
這真是無限combo….

這讓我想到cho提過,NVIDIA的人說G70這個結構本身有優勢。
現在看起來真的是不得不信服,這個看起來一點都不起眼(NV40的小改版)的東西還真是打不倒。

G7x剩下最大的暗樁應該就是開啟NUMA了吧…. 照這個專利 (Private addressing in a multi-processor graphics processing system)來看,其實目前的SLI系統都可以做到這點,只是要Driver支援而已。
也就是說,沒開啟的主因是因為缺乏兩個GPU中間的interconnection而已;而SLI雙16x勉強可以幫上一點忙….

指向性的神威

話說天地問到AP那部WL530:

天地: 對了,530怎麼了

AP:用6dBi的指向天線
直打200公尺遠的房子
(大概是200~250左右)
ping還可以低於100ms…

所以說指向性果然是勝利的關鍵!
(越來越想玩16dBi那個天線了)

而且AP似乎沒有去改輸出功率,也就是維持預設值的19mw…..(抖)
唔,我也想來玩了。
(雖然我說要買講一段時間了就是….)

AP後來補充,當時他是用11g來連線的,雖然後來出現其他用戶的時候還是得換成11b;而且為了穩定性,後來還是加到38mw。

從這點可以看出,空氣造成的衰減其實還是相當小,散射帶來的問題可能比較大….先前Hotball兄提到,美國有人try過,可以收到上百英哩的WLAN訊號,並且可以連線到對方那邊。(詳情還要再找找)

所以只要可以直線看到目標,中間沒有障礙物,都有非常大的價值嘗試看看。

於是AP又開始翻找Yahoo bid了….
http://tw.f4.page.bid.yahoo.com/tw/auction/d15755365