後藤老爹的Larrabee vs GPGPU

http://pc.watch.impress.co.jp/docs/2007/1011/kaigai392.htm
Intel NehalemとAMD FUSION
両社のCPU+GPU統合の違い

http://pc.watch.impress.co.jp/docs/2007/1012/kaigai393.htm
MIMDのLarrabeeとSIMDのGPUの戦い

裡面有幾個重點:

1. Intel認為GPGPU不切實際,相比之下Larrabee的programming style比較好。
對CPU廠商來說,要跟著GPU的結構去program,資料得做成texture來load、輸出是寫到frame buffer之類當然算是「非常に汚いプログラミングモデル」。

2. 因為GPGPU不切實際,Nehalem的CPU+GPU只是為了從結構上節省成本。(on-chip UMA SOC,也就是Tinma)
如果是為了low-end結構的話,也不需要讓GPU跟著遊戲市場快速更新,反正只是Vista Aero用。

3. 「MIMDのLarrabee対SIMDのGPU」。
把Larrabee和GPGPU之間的對抗,比喻成就像過去HPC市場Cluster vs Vector Processor般的對決。
內文引用Intel人員的發言,指出Larrabee是個MIMD machine,但具備一般的階層式快取結構。

「我々が示したLarrabeeのダイアグラム図を見ればわかるとおり、LarrabeeはMIMDマシンだ。MIMDマシンに、コンベンショナルなキャッシュ階層を接続した構造となっている。そのため、非常にライトウエイトで低レイテンシなスレッド間コミュニケーションが、(プロセッサコア)アレイのどこからでも可能だ。

 この構造は、今日のGPUとは大きく異なっている。GPUはSIMDマシンで、かなりの大きさ(のベクタ)で扱っている。MIMDマシン対 SIMDマシンの話が繰り返されている。また、GPUは、(伝統的なキャッシュ階層も持たないため)スレッド間の(コミュニケーションの)レイテンシははるかに長い。

 MIMDであり、コンベンショナルなキャッシュ階層を持つ。この2点がLarrabeeの違いとなる」

因為Larrabee有階層式快取(每4個core共享一個L2、整個Larrabee共享一個L3?),所以thread與thread之間比較容易透過cache以較低的latency作溝通;GPU的話則是希望每個thread之間完全不做溝通。G8x則是介於這兩者之間….因為G8x還是有階層式的share memory、cache等等等結構,但是thread之間的溝通只要離開TPC之後就會變得越來越麻煩。CELL的話觀念又不一樣了….

http://nueda.main.jp/blog/archives/002989.html
NVIDIA aims for 3 TFLOPS with next high-end GPU

3TFLOPS的話,帳面上其實是已經超過兩倍了….以NVIDIA來說,G80->D8E這段成長基本上是每年性能2x的既定歷程,所以下一顆晶片(G100? D9E?)變成要在一年後達到D8E的兩倍性能的話,就要考慮65nm或是55nm的承載能力,然後改變結構來滿足這個要求。

和當初NV40 -> G70的狀況很像,每次高階製程都會先用低階產品設法熟練後拿來做高階,所以我想D8x裡面會有一顆晶片推出55nm版,最可能的應該是最低階的UMA chipset;其次,如果接下來的產品線還要同時滿足D8x般四層的產品線,那代表有兩個可能:

1. D9E = D8Ex2、D9p=D8px2 = D8E同等,所以D9E可能高達D8p or G80的4倍大。(!!)
2. D9E = D8E控制面的同等規模設計、但高時脈化、同時附加單元規模擴張。

後者的話電晶體數量會比較小,而且相比直接改善的性能會比較受限;但是良率會比較好,尤其是55nm並不像45nm一樣,實質上是65nm的 half node製程,性能與承載能力相對於65nm的改善應該有限,冒險作超大晶片的價值應該不大….至少D8p已經讓人感受到G8x系列縮小上是有瓶頸存在的。

此外,假設D8x無法支援DX10.1的話,那D9x系列會有必要實作DX10.1。

從這些點考量,再回頭考慮上面寫到的3TFLOPS的部分,我相信D9x會使用4D、並且把空出來的乘載能力拿來改善GPGPU等其他非繪圖性能部分的要求。

不過,像cho就比較支持1D是G8x主要的價值的說法,所以認為1D還會持續相當長一段時間,那麼上面兩點的前者就會跑出來….那麼就會出現任何狀況都維持D8E兩倍性能的超強大GPU了。就算折衷一點的話,也應該會有1.5倍數量的TPC、1.3倍時脈的設定。

結論來說,如果NVIDIA不再用1D而用4D的話,上面這個性能(3TFLOPS)只要192個4D MAD跑2GHz其實就可以達到….不過回頭用VLIW的話compiler也會問題多多,如果考慮compiler短期內性能可能與G92 GX2也不會差太多,意義不大。
但是55nm是half node,乘載能力應該不會差太多,真的要做個兩倍大有困難….用傳統的規模1.5倍、時脈1.3倍來做的話又會耗電量會大幅提升….

總之這個3TFLOPS的數字很微妙,畢竟當初說G92單顆1TFLOPS、或者是總計8TFLOPS的計畫最後好像都沒有達到(至少D8E好像很難講是當初的G92,而且D8E也應該很難”再GX2化”),或許對現在這個數字也不該太認真。

[EDIT]

第二篇補上,裡面提到「Intel認為CELL失敗的原因是因為沒把SPE做成POWER/PowerPC ISA」。
不過他們萬事都想用電晶體硬幹解決的心態老實說是不太可取….如果今天SPE具備完整的PowerPC ISA,我很懷疑現在SpursEngine的耗電量會不會根本就是無法接受的巨量。
更別提Larrabee裡面可是x86….

不過實話是從普及觀點來說,如果OS看起來就是一堆一模一樣的x86,只是用編號來分哪些core做哪些事情的話,那的確是單純許多。

另一個問題是這篇訪談裡面有下面的問題發言:

「我々が望んでいるのは、Intelアーキテクチャ(IA)の力でグラフィックスプログラミングを実現することだ。しかし、IAと言っても、データ並列アーキテクチャのパフォーマンスを実現する点に、Larrabeeのアーキテクチャ上の新しさがある。

 どうやってIA互換性を維持しながら、(データ並列アーキテクチャの)パフォーマンスを実現するか。その点についての基本的なアプローチに、我々とAMD/ATIとの違いがある。簡単に言えば、彼らは、CPU+GPUワールドを目指している。我々はCPUワールドに、膨大な浮動小数点演算機能を加えることを目指している」

也就是說,雖然AMD仍然希望能把GPU的shader與CPU結合,然後把GPU的ISA整合進SSE5的指令等等來做到較密的結合,但是基本上GPU還是做為co-processor來運作,硬體實作上也還是具備GPU的特性;但是Intel就是要完完全全用CPU,而且是各種不同的CPU來解決平行處理的問題。

所以極端一點來說的話,FUSION加上去的GPU是不能跑OS,和SPE一樣只能當輔助處理器;但是Larrabee上頭的IA CPU和其他Intel的CPU一樣可以跑OS….。

「Larrabeeは、広いレンジのコンピューティング問題を狙っている。スループットコンピューティング、ビジュアライゼーション、財務分析、 HPCなどだ。しかし、今回発表したのは、最初の製品はグラフィックスになるということだ。ゴールは広いレンジのワークロードをカバーする製品群だが、最初の製品はグラフィックスだ」(Gelsinger氏)

從訪談內容來看,Intel真的打算用CPU來當GPU用了。

由於x86的關係,和現行的GPU延伸產品相比Larrabee會有極大的overhead存在,這會造成效率上的落差,所以後藤老爹認為如果把Larrabee視為”有附加功能的Graphic”的話,那麼這時候把先前發生的Havok收購考慮進去就會變得合理。

當然這種硬幹的做法能夠持續到什麼時候,還有用自家製程乘載能力與經濟能力當後盾硬幹的諸多浪費行為到底能不能把其他競爭對手都拖死,就有待時間證明了;或許Intel真的有辦法拖到其他對手(A/N)得全部結合起來和他對抗也說不定。

日本新數位地上波錄影模式名稱統一

新名稱統一為「Dumping10」(ダビング10)
http://www.watch.impress.co.jp/av/docs/20071009/jeita.htm
地デジ録画の新ルール名を「ダビング10」に統一
-アナログ出力は「コピー可」に。
JEITA発表

コピーワンス(上)とダビング10(下)の運用ルール比較。
アナログ出力のコピー制御にも違い

也就是說,至少可以做到
1. 無痛的HD類比擷取(不限制低解析輸出?) <–由於PV3/PV4的關係意義似乎不大….
2. 有限次數的數位轉錄

完全無限制總是比較好….不過總之有進步。

40GB PS3 日本與台灣發售預定

SCEJ、40GB HDDを搭載した新PS3発売決定
従来モデルは約5,000円の値下げ
「DUALSHOCK 3」も11月11日発売

SCEJ 將於日本地區推出 40GB 款式 PS3 主機 台灣地區同步跟進

這回PS3真的是先買先贏了…. orz
製程沒換的狀況下還要減低成本只有四處刪….

不過刪到SACD就真的搞不懂了,SACD的實體層不就還是普通的DVD,刪軟體功能有什麼意思?
會不會是為了避免先購買群的反感而暫時disable功能,等日後再和軟體模擬一起加回來?
好像不像…..也許久多良木健的高階AV路線要被肅清了….orz
PS3的Player進化路線看來是到此為止了?

總之沒了SACD,かないまる應該會很不爽吧。
如果CD upconverter還有的話就不算太差….

[EDIT]有一個說法是省SACD授權費….我以為SACD完全是SONY自己的東西,結果是SONY+Philips共同開發。如果還要授權費的話那的確省掉是一個手段….
只要最近的update裡面CD upconvert還是有照預定增加Bitmapping type3的話問題就不大。

 外形寸法は従来モデルと同じ約325×274×98mm(幅×奥行き×高さ/横置き時)だが、重量は軽量化され、約4.4kg(従来モデルは約5kg)となった。消費電力は約280W(従来モデルは最大380W

http://www.itmedia.co.jp/news/articles/0710/09/news093.html
因為是90nm CELL & RSX,希望這個耗電量減少不是用削減RAS帶來的。

PCinLife的Larrabee相關討論

http://we.pcinlife.com/thread-828668-1-1.html

裡面RacingPHT兄提到一點很有趣:Larrabee看起來像是把Xenon(PPE + VMX128)堆起來的樣子。

x86 vs PPC
512bit SIMD vs VMX128
2 threads vs 4 threads
双方的单线程通用指令性能都很烂(~1/3于该指令集的最高水准)
两边的基础指令集都不怎么样

所以根据这个惯性推论的是, 同样的Peak的前提下, Larrabee的实际性能不如SPE
(by RacingPHT)

實話是PPE在CELL相關slide裡面被拿來當挨打對象的次數幾乎僅次於P4/Netburst….性能上是的確有點落差。
而且論die size的話,PPE的空間足足可以塞兩顆SPE,PPE+512KB L2的空間幾乎就是4顆SPE。(其實扣掉XDR和FlexIO之後Xenos和CELL的die size就沒差多少了)
所以如果來個裝到32core的PPE,考慮需要配置的Cache,同樣的空間只怕裝到64個SPE都還有剩。

不過至少PPE和PPX到目前為止使用率已經很高了,但是SPE的使用率還是低得讓人掬一把同情的淚水…._A_

新清士的CEDEC報告

http://it.nikkei.co.jp/digital/news/index.aspx?n=MMITew000005102007
新型ゲーム機と格闘するソフト開発現場・CEDEC報告

 

 平山氏の講演であらためて驚かされたのは、ハード性能の向上に伴いゲーム開発費に占めるグラフィックスのコストの割合が肥大化しているという点である。パワースマッシュのチームは、「10人体制で1年サイクルで開発する」のを常としていた過去とは大きく違った。次世代ハードの登場が近い時期の開発であり、当初からPS3などへの移植を前提としたこのタイトルでは、チームが30人規模にまで膨らんだという。

 そのうちグラフィックの担当者は20人にもなり、絵素材の作成に非常に手間がかかったという。登場する選手1人の3次元モデルを作成するだけで2カ月近くかかり、それを12人分も作成した。

和大部分的PC Game一樣,因為content creation的效率改善有限,結果變成畫面想要做大排場,那就得用人海戰術,結果就是工時等於成本、技術等於花時間,無限膨脹下去;Halo3的低解析度也在這邊被拿出來作同義的例子,如果和前面的BioShock經驗一起看的話,新清士的觀點就是"朝FullHD冒進會帶來失敗"了。XD

「たかがテニスゲームを作るだけで何億円も飛んでしまうこの狂った時代」

….但是我單純覺得這個市場朝繪圖花太多心力了啊。明明推動這些東西的成本又那麼受限,光G80一顆晶片就已經比CELL+RSX或者是Xenon+Xenos還大了。

Power Smash 3其實畫面算是相當不錯,不是shader缺乏的低規格畫面,至少和TK5DR相比實在是落差非常大。

當然繪圖是遊戲讓玩家設法吸引人的第一關,但是看著NDSL帶來的改變,為什麼不會覺得當初PS3也是想說"繪圖已經差不多夠了",接下來應該靠CPU多做點繪圖之外的內容(當年PCwatch後藤大叔對久多的訪談就有這些內容),而不是再把這些CPU power又繼續砸到繪圖上….那或許真的不如做一顆P3 or P4 + G80砸下去就好了….所以如果繼續繪圖這條路線的話,的確看起來會有什麼東西都拼不過PC的感覺:只要大家願意為了PC無限投注硬體成本下去,更新週期長很多的console當然沒辦法繼續競爭。

但是就像和CPU相比,GPU的更新速度快得多,所以GPU整合進CPU的話沒多久內含的技術就會落伍…就無法成為遊戲市場進步的動力了;反之,如果遊戲市場的進步動力幾乎等於GPU市場進步的動力(目前看來辦正事領域的需求都還不如遊戲這麼大啊),那遊戲的未來不朝繪圖進步的話,還會有GPU市場嗎?

PS3 40GB正式發表

http://www.scei.co.jp/corporate/release/071006.html
http://www.scee.presscentre.com/Content/Detail.asp?ReleaseID=4434&NewsAreaID=2
(SCEE有高解析照片)

內容一如謠傳:
1. PS2 chipset完全取消
2. 有Wi-Fi但是沒有讀卡機、正面USB port減少至兩個等細部costdown

青蛙老大:一切都在掌握之中….(噗

純軟體PS2 Emulator目前還沒有上線,從硬體來說可以正常模擬的機會也實在不大;PS模擬器因為沒有影響所以保留。
以某種觀點來說,PS3拿掉PS2向下相容的同時,市場策略上搭配PS2本體降價的話倒是可以容許的,日後等軟體模擬成熟再補上即可;但是畢竟PS3的upscale效果非常巨大,所以很難不被拿出來鞭….

只是說實話,先前在講PS3 upscale多好多好的時候,還不是一樣有人說”哪有人會買PS3來玩PS2遊戲”,結論還不是一樣為了鞭而鞭…._A_
拿PS3寶貴的三波長讀取頭去讀手邊已經使用多時免不了有磨損的PS2光碟片,想想看自己會不會心痛?

總之,會在意PS2 upscale的人應該適合去拿PS2 20GB/60GB存貨…._A_

不過40GB刪掉SACD個人認為極不可取

補充:Techon CELL相關(CEATEC)
http://techon.nikkeibp.co.jp/article/NEWS/20071002/140080/?ST=lsi
【CEATEC】東芝がSpursEngineで画像認識の実演,CG合成はGPUで【動画あり】
http://techon.nikkeibp.co.jp/article/NEWS/20071003/140148/?ST=lsi
【CEATEC】東芝,Cell第2世代のリファレンス・セットを発表,冷却は空冷式に
http://techon.nikkeibp.co.jp/article/NEWS/20071003/140172/?ST=lsi
【CEATEC】ネットに溶けていくCellの実行環境

補充2:
http://techon.nikkeibp.co.jp/article/NEWS/20070130/127140/
ソニーがPS3のコストダウンに着手,「65nm世代の製造技術でCellの量産を開始した」
「65nm世代の技術を使うことで,90nm世代に比べて,Cellのチップ面積を約40%縮小できる。これによりコストダウンが可能になる。そして,65nm世代のさらに先も検討している」
基本上65nm理論上可以減少到52%左右,也就是可以減少約48%的die size….所以約40%可能是實際上CELL的die size減少的幅度;發熱量方面可以參考QS20與QS21之間的散熱片大小差距。

所以65nm的PS3如果出高低差版的話,高版應該可以補上不少東西。

GeForce8續報3

http://www.mobile01.com/topicdetail.php?f=298&t=413501&last=3742976

因為8800GT目前的設定(G92/D8p、6TPC or 96sp、256bit、1800MHz、256 or 512MB)非常可能因為廠商推出超頻版而超過8800GTS-640的性能,所以產品區隔策略改變,NVIDIA偷偷把8800GTS-640從6TPC改為7TPC(112sp)的規格。
而8800GT基本上就是8800GTS-320原來的定位….只是現在出現一個問題:

NVIDIA will NOT be doing any formal launch activities, press announcements, website updates, or any other marketing around this new sku. Partners can conduct their own marketing activities around the sku as they see fit.

所以市場上可能會出現兩種88GTS640的產品但是性能不同,混淆視聽….
不過我是覺得到時候裡面的G80偷偷變成384bit封裝的G92/D8p就更爆笑了。(畢竟用兩個晶片cover四個產品線是很可怕的事情)

8800GT和新版的8800GTS 640將提早上市,原定11/12,現在提早到10/29上市!沒錯,這個月就要開始DX10「真.中階卡」的戰爭了。
(by G.F)

[EDIT]
http://www.mobile01.com/topicdetail.php?f=298&t=417148&last=3785774

GeForce 8800 GT會有112個SP
.SP時脈達1.5GHz
.記憶體時脈900MHz(有效1.8GHz)

取得第一份有載明D8p具有7TPC以上單元、與每TPC具備完整16SP的確認資料文件。
所以D8p確認是完全具備直接取代G80能力的晶片,這點也與RV670同等….

就看到時公布的die size和電晶體量多少了。

[EDIT2]
http://we.pcinlife.com/thread-830762-1-1.html


G92全線取代….

http://www.theinquirer.net/gb/inquirer/news/2007/10/10/nvidia-g92-little-g80-65nm
INQ表示G92的die size為17×17 289mm^2….
RV670先前聽說是196mm^2,應該是65nm與55nm的差異。
比例放大的話接近先前G80和R600之間的比例。

CEATEC2007開展

-Panasonic的Blu-Ray DIGA發表-
http://www.watch.impress.co.jp/av/docs/20071002/pana1.htm
BW700/800/900系列,第一台UniPhier採用機的關係,整個基板零件數大幅縮減。

同樣也有AVC CODEC,只是只配有一組,不能做同時二番組AVC錄影;但是因為可以對硬碟已錄影的作transcode的關係,所以夜間可以設定對MPEG2的作transcode來節省空間。
流量的選擇為12.9M、8.6M、5.7Mbps,所以想想其實XBOX360對AVC只提供到15Mbps的解碼能力算是足夠。<–雖然這幾天扔14Mbps ABR的AIR-OP給人家播好像不太順暢。
PS3提供到更高的40Mbps class(也就是說和BD的decoder共用)似乎意義就不大….?以自己的測試,peak可以到120Mbps前後都還沒問題,這也毫無疑問超過BD的能耐。

另外一個有趣的東西是這系列錄影機提供視訊門鈴的支援,透過PLC可以連接VL-SP880,並且錄影門鈴的影像,沒人在的時候可以錄下有誰來串門子撲空過。
http://big5.nikkeibp.co.jp/china/news/mobi/mobi200708170110.html
http://big5.nikkeibp.co.jp/china/image2007/08/070817vie2.html
看起來,如果PLC”真的”夠便宜的話可以裝到大部分家電上沒錯,但是目前看來PLC實在是離便宜有很大的距離。
只是目前看來Panasonic的PLC目前還是在衝頻寬(不然就不會叫做HD-PLC了吧),大部分的家電如果只是要做控制的話的確是不需要什麼大頻寬….
那麼早期的一些低頻寬版本再加強一下抗干擾能力(雖說有noise filter另外賣)之後,應該就會相當有潛力才是。

也就是說,”錄影機”這個裝置的存在是客廳裡面最接近PC定位的產品。
過去資訊化的方式是讓PC具備錄影機的功能來試圖取代錄影機,是Intel之類廠商的思考;而家電商的思考當然就是讓錄影機本身有一定程度的運算能力。

結果最激進的解決方案當然就是CELL了。_A_

-SpursEngine Demo-
http://pc.watch.impress.co.jp/docs/2007/1002/ceatec01.htm
http://www.watch.impress.co.jp/av/docs/20071002/ceatec03.htm
http://plusd.itmedia.co.jp/pcuser/articles/0710/02/news061.html

從旁邊的針腳對比起來,die size還蠻小的….用Notebook跑化妝鏡demo的時候,首先只用CPU來執行,usage吃滿外加frame rate半分;開了SpursEngine讓SPE處理之後,CPU usage約30%、frame rate也拉高到30fps滿。
Qosmio畢竟是Santa Rosa平台,所以合理地看即使SpursEngine也有Core2Duo系的數倍性能….不過ITmedia那張圖來看,整個module的size其實大約和MXM的GPU差不多。

同時期AGEIA PhsyX也推出Notebook的solution,考慮泛用性的部分,Toshiba不知道有沒有單獨販賣的打算…
(畢竟AGEIA目前沒有把PhsyX開放跑別的東西的計畫,但是SpursEngine可以cover PhsyX的工作)

Cellの技術を利用した映像処理プロセッサ「SpursEngine」

[EDIT]
http://www.ednjapan.com/content/l_news/2007/10/u3eqp30000019q53.html
小型化/高性能化が進んだ東芝のCell向け開発環境

http://techon.nikkeibp.co.jp/article/NEWS/20071003/140172/
【CEATEC】ネットに溶けていくCellの実行環境

這篇有CELL的H.264 AVC realtime Transcoding的demo;不過encoding還沒辦法real time。

65nm版XBOX360出貨

http://www.xbox-ism.com/index.php?option=com_smf&Itemid=26&topic=361.0
CPU 65nm化,拆機照片。

然後….
http://www.n4g.com/xbox360/NewsCom-71365.aspx
還是有RROD報告。

本來熱的就是GPU端而不是CPU端,光改CPU要壓低總熱量並不容易。
所以GPU沒改65nm的話看來沒辦法解決。(改了也不見得能解決?)

SONY內部反對採用65nm化CELL的原因,主要也是因為RSX沒有65nm化的話得到的改善並不大(如同Falcom版”半65nm”),應該要等90nm版用完而不是混用….