分類彙整: Uncategorized

B3D的Tesla T10P/GT200 for CUDA review

http://www.beyond3d.com/content/articles/106/

Beyond3D:Tesla 10 & CUDA 2.0: Technical Analysis & Performance

目前改進的範疇都還是用起來比較方便,但是GPU對一般的programmer來說還是很麻煩,因為你要知道為什麼你的程式快不起來,你就非得去了解GPU架構;而Larrabee應該會以幹掉這個部分為主要的賣點….

Missing MUL的問題:在G80時代只有在CUDA底下才能發揮出來,在GT200似乎只要一些排程上的小限制就可以在大部分的狀況下達到理論值;目前PCIe 2.0的頻寬利用率在CUDA底下是大約6GB/s,即總頻寬的75%。

PCI-Express 2.0目前”總算”達到雙向傳輸,或者是邊做單向傳輸、邊做運算;下一代會做到運算與PCIe雙向傳輸可以同時進行。

目前看起來最大的改進可能是那個沒有大幅宣傳的Memory read/write combine(Atomic unit),G80的時候每個warp都還是需要循序讀取、不然就得自己讀進share memory後再排序,這點看起來算是大改進。

雖然B3D敘述的時候講得很保留,說沒什麼魔法、只是會方便些….XD

出來走的總是得還:RV770的內部bus設計

http://pc.watch.impress.co.jp/docs/2008/0626/kaigai450.htm

Radeon HD 4800の高パフォーマンスの秘密

當初R600和G80最大的差異,除了每個core的結構之外,另一個就是對內部bus的設計看法。

G80對每個core(TPC)都配置了獨立的L1、並在ROP配置獨立的L2,中間以Crossbar連接,對記憶體控制器則再以crossbar連接。

相對之下,R600在這邊的設置是「所有的core共用一組32KB的texture L1、256KB的L2」以crossbar和RenderBackEnd連接後,再以ringbus來連接記憶體控制器。RV770現在每個core都有Texture L1 Cache 、四組ROP也都有Texture L2 cache,最後不論是core和RBE/ROP、或者是RBE/ROP對下面memory controller的連結,都是採crossbar。

說起來,這完全是跟隨NVIDIA的設計…. ATI的processor array,在遲了一年半後總算是和NVIDIA的TPC在設計上達到對等的程度。所以目前其實RV770和G92,幾乎就是10core(more processor) vs 8core(double clock)的勝負。這個方向其實並不是沿襲R600過去的「製造至上」的哲學,而比較像是「processor受到壓力所以提高對GPU市場的依賴度」這個部分,花下了更大的心力在GPU上。

我是覺得如果未來要走向數十個core的程度,是可以考慮ringbus和mesh network啦。

比方說,CPU和shader core都用ringbus 或 mesh連接,並且內附cache和一定程度的register file來對抗延遲;然後連到ROP、ROP這邊會有Texture L2和讓CPU使用的L3 cache,再看規模用crossbar和memory controller連接….

就和SPE靠MFC做位址轉換一樣,其實GPU core只要做類似的位址轉換就可以做出NUMA來,比方說這篇:

https://www.cs.tcd.ie/Michael.Manzke/research_HPGraphics.html

A Shared-Memory Hybrid Graphics Cluster for Visualisation and Video Processing [HPGraphics]

paper:

https://www.cs.tcd.ie/Michael.Manzke/publications/manzke_ERSA_2007.pdf

用SCI(Scalable Coherent Interface)的方式實作的NUMA介面,直接轉到AGP上頭,所以就可以替AGP的GPU做出NUMA;但是這顯然太多overhead、介面也太慢,但是如果把這樣的位址轉換單元作在TPC、processor array上的畫,就可以達到NUMA的平面記憶體定址才是,剩下的只要CPU core和co-processor core都能共享同一個記憶體定址協定,就可以混合各種不同的CPU core才是; 不過ROP這種東西似乎就比較麻煩一點,一定得跟在記憶體控制器和次階快取系統上,這讓傳統CPU很難花這麼大的成本來實作….(為了達到高效率,ROP單元幾乎吃掉目前GPU約1/3~1/4的規模)

—-

另外,RV770因為ROP和memory之間換回crossbar,也順道大幅地強化了ROP本身的規模,讓頻寬利用率可以提升。

ATI自己的數據:

RV670/RV770 ROP thoughtput pixel/clock

32bit|noAA|2x/4x|8x

RV670—16——-8——-4

RV770—16—–16——–8

64bit|noAA|2x/4x|8x

RV670—-8——–8——–4

RV770—16——16——–8

Z/stencil only

RV670-32

RV770-64

可以看到相較於RV670只有在32bit noAA下可以single cycle輸出,RV770可以做到32/64bit 4xAA下都能single cycle輸出color….並且z/stencil的速度從2x變成4x。

AMD forum的一些本音洩漏

http://forums.amd.com/forum/messageview.cfm?catid=328&threadid=94180

The XYZW are the vector element and the T is scalar. Each SIMD processes 16 elements a cycle over four cycles, giving a granularity of 64 elements on 670. The wavefront size, which is different from chip to chip, is this granularity and all instructions in a kernel are executed on group of elements at the wavefront size.

(by Micah Villmow)

所以不論G80或是R600,目前沒有哪個GPU不是4D vector + something else構成的,都不是什麼1D scalar unit…. XD

只是ATI每個core(array)塞了16個4D,NVIDIA每個core只有4~6個4D,結果因為設計複雜度之故,兩邊每個core居然差不多大….。

In-game XMB詳細內容

http://www.ps3-fan.net/2008/06/240ingame_xmb3.html

Ver.2.40「In-Game XMB」の詳細が公開?アップデートは3週間後?

剛好是E3開展之故,以大型update來說的確合適。

 「In-Game XMB」でアクセスできるXMB機能も明らかになっています。

* フレンドカテゴリ

* メッセージを見る、送る、受け取る

* ダウンロード管理

* コントローラの振動機能の設定

* フレンド登録

* ブルートゥースデバイスの管理

* ゲームの終了

* 音楽カテゴリ

* システムBGMの利用

* システムBGMのオペレーションパネルの操作

* セッティングカテゴリ

* コントローラの割り当て

* プロフィールの表示

* ゲームカテゴリ

* オーディオデバイスの設定

* ボイスチェンジャーの利用

絕讚鞭屍中

http://gigazine.net/index.php?/news/comments/20080623_jva_net/

アニメを録画されると利益が減るから「私的録画補償金が必要」と日本映像ソフト協会がめちゃくちゃな意見を表明

http://business.nikkeibp.co.jp/article/manage/20070213/118877/

アニメ制作会社はどう”儲ける”べきか ~プロダクションI.G 石川光久社長インタビュー(前編):NBonline(日経ビジネス オンライン)

誰が聞いても

「最近は昔みたいに利益が思うように出ないから金よこせ」

「儲からないから無料の私的複製は認められない、金よこせ」

と言っているようにしか聞こえません。

有膽就全部變成付費頻道啊XD

—-

先前三浦老師幫Internet的Gackpoid畫封面的事情的一些負面批判:

http://d.hatena.ne.jp/okgwa/20080622/p1

「プロは素人の相場観を狂わせてはならない」のほうがより正確かも。

http://d.hatena.ne.jp/y_arim/20080620/1213943040

プロは無償で商品を作ってはならない

http://d.hatena.ne.jp/y_arim/20080621/1214095147

自己批判してみるよ

http://d.hatena.ne.jp/imeanit/20080620/1213968058

「イラストを無償で提供」はヤラセじゃないの?

http://scientificclub-run.net/index.php?UID=1213977394

「三浦健太郎先生が無償で書いてくれました!!」って本当にいいことなのかな?

就是說,三浦老師「免費跨刀」這件事情一來影響未來工作的價碼、二來也會讓「這些宅」食髓知味,以後其他的人都不能在這上面要錢之類,「連那個三浦都不拿錢了你是什麼貨色」等等。(剛好裡面有個號稱是繪師啊)

當然另一個觀點是,這是個大規模的promotion,都是在營造CGM的氣氛,只要氣氛好user就可以繼續做下去,然後nico躺著賺之類。

不過我很想講,那nico獲利了沒?XD

還沒吧。光頻寬費就把上面那一點點利潤都吹走了,Youtube現在也是一直在燒錢啊。

要不就是user付費、要不就是用p2p讓user拿頻寬出來,不然任何content不可能無償地傳輸到user手上、user做的東西也不可能無償地跑到其他user家裡。

所以營造氣氛讓CGM可以做下去的確是很重要的,這些東西本來都是「user看爽了才付錢」,到目前為止user除了少數的付費user之外,都只是照樣看了就跑而已,偶爾荒らし一下也沒辦法怎麼樣,還可以喊運營死ね呢。

這只能算是一點誘導啦,和下面的混蛋發言比起來還不算什麼呢。

http://www.itmedia.co.jp/news/articles/0806/25/news018.html

「権利者こそが消費者重視、JEITAは見習うべき」――補償金問題で権利者団体が会見

原來同意Dump10是權利者團體的天賜神恩呢。當初沒有DRM free不是你們講的?

DRM是替你們做的,因為你們不願意沒有任何保護來出片子,所以才說要做DRM,補償金是一開始就在收的。

DRM增加的不便,和補償金合起來就是收兩次錢了。

有膽就全部付費頻道、只出收費package啊?權利者自己也知道這樣活不下去吧。

那為什麼還敢說是為了消費者方便所以開恩?事實上是「如果不這麼做,怕消費者就不鳥你們了」吧?

不如就一次全滅下去讓nico成為主流吧,後面還有CCJP等著呢。

http://b.hatena.ne.jp/entrymobile/9068508

はてなブックマーク: 「権利者こそが消費者重視、JEITAは見習うべき」――補償金問題で権利者団体が会見 – ITmedia News

[ITmedia] CCJP x PIAPRO 續報

http://www.itmedia.co.jp/news/articles/0806/24/news011.html

クリエイティブコモンズ公認キャラ募集 VOCALOID化も

「さまざまな権利が交錯・衝突するネット文化の空間のひずみに突如出現したCCを司るデジタル生命体で、固定された姿もなく性別もない」

「0と1の情報によって構成された身体の形状は環境に応じて変化し続け、有象無象のデジタルコンテンツという大海の水面上を気の向くままに飛翔し、前人未到の創造の共有地へ導く歌をほがらかに響かせる」

感想:….Office的迴紋針小幫手?(核爆)

——-

http://piapro.jp/static/?view=miku_car



…..おい。

Toshiba的SpursEngine內建筆電Qosmio G50/F50

http://pc.watch.impress.co.jp/docs/2008/0623/toshiba.htm

東芝、SpursEngineを搭載したAVノート「Qosmio G50/F50」

SpursEngine主要用在數位地上波收視/錄影的附加功能上。

内蔵の地上デジタルTVチューナの映像を録画する場合、MPEG-2 TSだけでなく、ビットレート2~10MbpsのH.264でリアルタイム録画ができる。録画済み映像の変換もハードウェアで行なえる。

さらに、 H.264ハードウェアエンコードの前処理でSPEを使って映像を解析し、映像中の人物の顔をインデックス化。出演者の顔のサムネール、音声レベル、一定間隔ごとのサムネールを表示する「顔 de ナビ」機能で、任意の場面から再生できる。

「顔 de ナビ」:在H.264 Encode之前先用SPE做影像分析,收集影片中的人臉、並以人臉為index來做場面搜尋的設計。

—-

http://www.watch.impress.co.jp/av/docs/20080623/dal331.htm

第331回:ヤマハがPCMレコーダやUSBオーディオなどを発表

~ “Made in Japan”のSteinbergハード製品も ~

YAMAHA和SAMYO合作IC recorder「ICR-PS1000M」,結果果然出了YAMAHA自己的版本「POCKETRAK CX」。

一來沒有指紋辨識、二來附贈CubaseAI4和2GB SD、然後也附了防風罩和腳架轉接器,相關參數的preset落差也不小。

很可惜只有16/44、沒有24/96對應….

入門用USB Audio Interface「AUDIOGRAM6/3」雖然只有16/44對應,但是有XLR、MIC-preamp、甚至還對應PHANTOM電源,其實連接能力相當好。

MM8和KX8用的88鍵鍵盤是高低音輕重不同的GHS(Grade Hammer Standard)鍵盤,很接近實際鋼琴的觸感。

到了這個程度,鍵盤的成本已經高過半導體零件部分了….XD

所以即使MM8有MOTIF的發音結構,兩者價錢只差約1/3(998,00yen vs 698,00yen)。

G80/RV670 register file完整資訊,以及隱藏的結構性質

http://www.cs.ucf.edu/~zhou/dlp.pdf

Experiencing Various Massively Parallel Architectures and Programming

Models for Data-Intensive Applications

Thread Hierarchy

G80:16 Stream multi-processors (SM), 8 streaming processors (SP) per SM, 4 SMs share 1 Texture subsystem

RV670:4 clusters, 16 x 5 cores per cluster, each cluster time-multiplex 1 Texture subsystem

Register File (32-bit registers)

G80:512 kB = 32kB per SM * 16 SM; 8K registers per SM; 1K register per SP

RV670:1MB = 256kB per cluster * 4 cluster; 64K registers per cluster; 1K register per core

這太精采啦XD

所以R600的觀念其實是比G80更大的register file,然後不具備G80的shared memory。

R600/RV670的GPGPU要算得快的話,就是要配合大register file使用loop unrolling之類的技巧;

能算的東西則很類似Pixel Shader,因為只要做了thread interconnection效率就會很差,原因是R600沒有on-chip的share memory,只有讀寫on-board memory的FIFO。

此外,G80/G92是24個warp(32 threads per warp),R600/RV670則是每個array有192個”wavefront”(64 threads per wavefront),這個詞大概就是和G80的warp相對應。

一看很有趣地,G80是24×8 = 192warp total,R600/RV670也是192wavefront total,只是一邊是32threads per warp、一邊是64threads per wavefront,同時兩邊的egister file的規模也剛好是相差一倍,這下謎題都解開了XD

—–

這篇也確認了R600每個cluster上面的core(16×5=80cores)以分時的方式共用一個Texture Array(4D)。

所以RV670維持4個array對4個tex-array(4x4D),RV770增加到10個array,Tex-array也增加到10組4D。

G80到GT200的register file規模增加的幅度,是從8K registers per SM,擴充到16K,等於64KB per SM * 30 = 1.92MB。

R600的每個core都有自己的256KB register file,所以4個array共計1MB,10個array共計增加到2.5MB,其實比GT200提供的規模還大上許多….

當然RV770雖然看起來”只增加20%”電晶體,但是說起來這也是增加了超過200M的規模(666M->954M),所以說起來仍然很合理就是了。XD

也就是說,未來如果R600的架構要繼續增加SP,比方說現在在傳的「2000個SP」(25個array),其實考慮換成45nm之後大概也是和現在的RV770差不多大或者稍大。

而這也可以說是R600結構的價值所在。

—-

在G94推出前,光比較RV670和G92就會顯得R600結構效率很差,運算密度很低,然後G92的成本很高;G94推出時就會看到G8x的結構比R6x0可以更小些….

RV770推出後則把R6x0的運算密度提高,達到和G92可以對抗的程度。也就是說其實雙方的core(TPC vs ALU array)幾乎是可以單位上相對比的。

現在的問題就是RV770有沒有辦法以現在的方式拿出和GT200可以對抗的產品:

GT200顯示NVIDIA認為8TPC-256bit是適當,所以往上做就是16TPC-512bit(16TPC整合到10TPCx1.5,以縮小crossbar規模)

那麼,RV770之後謠傳會到2000個SP,可能是從10個array變成25個array;但是在此同時TMU的數量也跟著增加到100個,這時候還會是16ROP + 256bit(GDDR5)嗎?

要不然的話NVIDIA也可以拿更多TPC來搭配256bit,就可以快速地縮小看起來很巨大的GT200了….

從RV770可以看得出來,其實TMU和ROP在R6x0裡面也是占較大規模,所以只增加20%就可以達成不刪減register file增加總運算量。

Gackpoid封面決定,把三浦老師用時報叫出來

http://www.itmedia.co.jp/news/articles/0806/20/news043.html

「がくっぽいど」7月末発売 ”ニコ厨”漫画家・三浦建太郎さんのイラストで

Gackt声のVOCALOID「がくっぽいど」発売が7月末に決まった。

パッケージの「神威がくぽ」のイラストは”ニコ厨”漫画家の三浦建太郎さんに無償で描いてもらったという。

http://www.nicovideo.jp/watch/sm3484260

2008/05/30 0:00の時報

所以這個時報是Gackt登的orz

老師~你在看嗎~XD

http://ext.nicovideo.jp/thumb/sm3484260 http://ext.nicovideo.jp/thumb/sm3709686

這音質好KAITO…. 這下解雇難免了XD

所以卑怯 vs 變態之戰無可避免….

—-

[EDIT]

http://ext.nicovideo.jp/thumb/sm3713622

http://www.nicovideo.jp/watch/sm3713622

【がくぽ?】がくがくにしてくれる♪【KAITO】

來自KAITO的先制攻擊XD

發售之前就開始角色固定XD||||||||

歌詞裡面滿是超刻意的古語XD

source:http://pc11.2ch.net/test/read.cgi/streaming/1213933115/

225 名無しさん動画閲覧中@全板トナメ出場中 [sage]

Date:2008/06/20(金) 13:44:17 ID:G4pbEtC40 Be:

♪時空の境界を越えて 我は今来たのだ

 刀に刃はないが できれば欲しいぞ

 だから早く

 ぱそこんに入れぬか

 いかがした? 外箱をじっと見つめてる

 お主のことがっくがくにしてくれる

 歌はすぐに覚えるゆえ

 がっくがくにしてくれる

 潔く覚悟を決めるのだ

(捧腹)

だまし討ちとはまさに卑怯!XD