Bulldozer的如意算盤

http://ps3clan.nl/2009/11/sony-kiest-voor-ibm-power7-cpu-playstation-4/

SONY KIEST VOOR IBM POWER7 CPU (PLAYSTATION 4)

「As displayed by it’s choice of processors, the server based POWER7 and the TBDR based PowerVR 6, SCEI has sights set once again for performance leadership in the next round.」

POWER7+PowerVR6….搞錯沒w

一點都不像console用的設計….

—-

http://pc.watch.impress.co.jp/docs/column/config/20091127_331552.html

Silverlight 4があればWindowsはいらなくなるの?

只要微軟繼續在學校用量產體制生出依賴微軟的programmer,Silverlight4這樣把過去coding style整個移植到瀏覽器裡面的東西就可以很迅速地保留過去的軟體資源。

於是OS的Windows死了,Windows還是用Silverlight4在瀏覽器裡面借屍還魂….XD

—-

http://www.basschouten.com/blog1.php/2009/11/22/direct2d-hardware-rendering-a-browser

Direct2D: Hardware Rendering a Browser

Direct2D的Firefox實作。一般網頁loading的時候瞬間畫一下所以感覺不到明顯差異XDa

但是把背景圖像、放大縮小之類的東西考慮進去之後,比較之下就會很快。

—-

http://pc.watch.impress.co.jp/docs/column/kaigai/20091126_331235.html

2011年に登場するAMDの8コアデスクトップCPU「Zambezi」

AMD的Bulldozer架構在32nm下,die size頂多上探200mm^2程度的desktop市場上,最大的產品為8core的Zambezi。

以同級產品來說,Intel的Gulftown(i9)是6core。後藤老爹覺得這可能代表Bulldozer的架構讓它可以多放一點core,因為以過去的core這個單位來說,Bulldozer的規模是縮小的。

但是以thread的單位來說,bulldozer的性能並沒有打任何折扣,反之SMT的場合則有打折扣的可能,所以即使Gulftown是6c/12t,12個打折扣的thread(或者遇到問題的時後切回6thread)和8個性能維持住thread相比會吃虧,就是AMD的一個如意算盤之一。

事實上SMT有幫助的狀況下,也是會發揮接近20%的增長,在anandtech的測試裡面SMT在i7上發揮的性能(如encoding)就有非常明顯的幫助,所以先不管Bulldozer算不算對SMT的反應,針對同一個問題性能兩邊提出的方案的確有南轅北轍的差異。

至於浮點單元雖然從core單位上是縮減,但是一來single thread來說,只要用到的話還是有1至2個128bit FMA可以用,和過去相比並沒有減少還算增加,只是用到的機率減少的話降低FP數量的確是一個可以理解的選項,畢竟HPC市場AMD都打算交給GPU來衝了。

—-

話說LGA1156(Socket H)和LGA1155….

Gulftown看起來沒有LGA1156,LGA1155又直接給sandy bridge,怎麼沒多久就會變成孤兒的感覺orz

在〈Bulldozer的如意算盤〉中有 19 則留言

  1. 之前有測試結果是雙核心(4thread)以上效率越來越低.
    軟體同時跑的thread不夠多,更多core/thread
    反而發揮不出性能.
    以後的CPU受限於軟體平行化程度有限.
    應該是每個核心越來越強,(單核規模變大),
    但是核心數量的成長趨緩.
    以PC環境來說,Bulldozer的8core(16 thread)
    有發揮的空間嗎?

  2. Bulldozer是8core(8thread)….一個Bulldozer module是2個core一組的關係,所以這邊的8core其實是4module。
    軟體平行化程度有限,每個programmer都希望single thread的性能不斷提高,但是包含SMT也好bulldozer也罷,都沒有人改善single thread性能,而且我們都知道單核規模早就上不去了。
    對Bulldozer而言,它的一個module有兩個thread,可能性能會高過同樣兩個core的Nehalem,但是Nehalem的SMT性能可以發揮的時候有很大的機會超過Bulldozer,所以重點在於同樣的size底下Zambezi(8core Bulldozer)可以塞8core、超過6core的Gulftown(6core Nehalem)這件事情,這樣只要單thread性能大略同等或者Bulldozer比Nehalem稍微高點的時候,Bulldozer就有優勢。
    不過大部分的desktop環境底下,大略到4thread就碰到需求頂峰了,所以要不是dual-core Nehalem(2core4thread),或者是關掉SMT的4core Nehalem。
    而面對這兩個對手,感覺Bulldozer的優勢換來的並不多。

  3. 原來”core”講的是1/2的Bulldozer module.
    所以說的是8Core/8Thread/4module的Bulldozer
    尺寸相當於6Core/12Thread的Gulftown.
    Bulldozer的一個module,因為浮點資源共用.
    而且每core只有1Thread,所以Bulldozer
    1個module(2Core)的體積應該比2Core版Nehalem
    小多了, 比較起來平均每個core小了20%以上.
    雖然以單core而言,沒SMT,效率可能較低.
    但是以峰值效能來說,8Core有更高的整數運算輸出
    Bulldozer1個module比2Core Nehalem還小
    整數運算且無開啟SMT時,卻都是等同2Core運算能力.
    AMD有機會以成本較低的Bulldozer直追Nehalem的
    整數性能…

  4. Bulldozer體積到底會比2core版Nehalem小多少不清楚,不過如果比Core MA還小就很驚人了,大概還是大了一些才比較合理。因為Nehalem的單一core幾乎就是Core2世代的1.5倍,而且Intel號稱Nehalem基本上電晶體效率與Core2世代完全一樣。
    所以某種意味上,目前x86架構基本上single core能到的極限大概就是Core2~Nehalem之間,考慮Nehalem相對於Core2的大小,SMT讓每個core效率能再上探最高約50%性能沒錯,但是這樣算的話每個thread效率其實也大概降到約75%前後。
    反過來說,如果Bulldozer能維持幾乎core2同等的single thread性能然後還能縮小一點電晶體,然後換比較多module/core數的話,那Bulldozer就能用比較低的成本達到Nehalem的性能。
    和graphic不一樣的是,很多一般app都有一定程度的低latency需求,user比較不能忍受single thread的性能衝擊,目前大部分的app也都還沒有高平行化,所以bulldozer會有一些利點。
    只是這些利點在雙方都4core的時候只會以cache容量體現,而一邊8core一邊6core的時候才會真的看出價值,這也是在低階的2core範疇下,bulldozer看不出什麼優點的部分。

  5. 這有點像Phenom-II X4本來要出來挑Core2,結果出來沒多久就遇上Nehalem降臨一樣_A_
    Bulldozer正常來說對手應該會是Sandy Bridge….

  6. 姑且不論Bulldozer,Llano和Sandy Bridge-DT的較量就很有意思了:「弱CPU + 強GPU」與「強CPU + 弱GPU」的對決。
    從die photo來看,目前Llano規格是這樣:
    4 32nm K10 core, 512kB L2 per core, No L3, internal crossbar
    後藤大叔拼命從Intel IDF Keynote會場照片中硬生出來的Sandy Bridge-DT:
    4 32nm SB core (AVX support), 256kB L2 per core, 6MB L3, on-die PCI Express controller, Internal Ring bus
    兩邊記憶體寬度應該都是128 bits(64 bits x2),從AMD的說法來看,Fusion的技術重心有很大的部份,將落在那個CPU/GPU混用的Fusion memory controller。
    反正CPU整整落後兩個世代,GPU沒壓倒性優勢根本沒有板平的希望。或許可以猜猜看那個32nm GPU是什麼。
    兩邊市場區隔不太一樣,硬拿Llano和Sandy Bridge-DT比不太公平,不過AMD遲遲不把PCI Express放在CPU上,未來在I/O效率這部份可能會吃大虧(特別是SR-IOV和MR-IOV開始普及後),就看他們自己怎麼去設法彌補了。
    另外一個值得觀察的重點:cache coherence protocol和外部system bus/內部CMP bus的搭配性,相較AMD把Socket G34搞得這麼複雜,Intel在Sandy Bridge世代卻有精簡化的趨勢,4P/高階2P server系統的製造及驗證成本,可能也是未來AMD會吃虧的地方。
    雖然Intel Haifa團隊過去被貼上「紀律嚴謹卻缺乏創意,只會改良既有架構」的標籤,但這次Sandy Bridge的突破,也許會遠超過我的預期。

  7. >>反正CPU整整落後兩個世代,GPU沒壓倒性優勢根本
    >>沒有板平的希望。或許可以猜猜看那個32nm GPU是什麼
    之前看Fusion架構的die photo,
    http://www.xbitlabs.com/…_Stream_Processors.html
    中階的四核心.1B電晶體,若以32mm2,約200mm2的面積來看,
    GPU幾乎佔據大半面積.
    (那張圖把下半部切掉了,其實GPU面積相當大…)
    這尺寸的GPU起碼是DX11中階的水準,
    SP數量可能是480個,推測浮點效能約1Tflops.
    大約明年推出的中階HD5600的效能
    那比Intel現有的GM47顯示核心還強10倍以上.
    AMD很明白只靠CPU是不可能和Intel抗衡.
    所以打算靠ATI的GPU打不對稱的戰爭.
    (CPU跑輸你沒關係,我從GPU上贏回來….)
    連L3 cache都不做,就是擺明了CPU效能不是設計重點.
    有趣的是,以CPU/GPU的面積比例來看,
    AMD提出的方案,簡直像是用在遊戲機的極端比例.
    (把大部分電晶體成本用在顯示晶片上)
    過去Intel可以說GPU是遊戲用的,商用機種用GMA系列
    內顯就夠了,不過現在連OS都開始使用GPU做桌面加速,
    網頁與瀏覽器也走向3D,Flash,photoshop,媒體轉檔,
    全都開始支援GPGPU…..未來GPU已經不是遊戲專用.
    以整個Solution來說,弱CPU+強GPU的組合未來有可能
    在商用領域也慢慢佔優勢,但是什麼時候能佔優勢沒人能預測.
    目前來看,NetBook的熱賣可以看出,
    對一般人來說CPU的需求已經不太需要大幅成長了,
    需要用到4核的已經是少數.
    即使是所謂”4核弱CPU”也遠比雙核Atom強大多了.
    除了高階3D遊戲以外,幾乎用不到高性能CPU.
    但3D遊戲時,GPU其實比CPU更重要.
    這讓人更期待AMD推出的Solution.
    起碼在NB市場很有競爭力.
    在中階處理器的die size相差不大的情形下,
    CPU和GPU該怎麼分配電晶體,值得好好思考.
    英特爾和AMD走向了不同方向,想當然有一方會賭錯趨勢.
    是I社太遲緩還是A社衝太快,過2年再來看就知道了….

  8. Llano完整的圖來看應該是
    http://bbs.chiphell.com/…1266952d03e3f477209.jpg
    K10 core *4 +1MB L2 *4+PCI-E 16X 2.0+HyperTransport 16bit *4+240sp DX11 GPU。
    包含了PCI-E,不知道會用什么接口就是了。
    然后,4個HyperTransport更是讓人覺得詭異,莫非是要用于伺服器或HPC?

  9. > K10 core *4 +1MB L2 *4+PCI-E 16X 2.0+HyperTransport 16bit *4+240sp DX11 GPU
    3組或是6組都SIMD array….這很重武裝耶….
    而且32nm的200mm^2和Atom比不太對吧,整個是非贏Sandy Bridge不可的態勢。
    不過32nm底下的240sp比起480sp來說是合理許多,480sp的話可能就是dual core,cache也可能會變成512KB….然後競爭力就沒那麼高。
    就算是用上turbomode,sandy bridge的GPU要和240sp的DX11 GPU競爭大概是有點緣木求魚….
    但是反過來說,Sandy Bridge開SMT用dual-core來和「正4核」拼,加GPU大概也不用200mm^2,用撒的低價來和Liano拼,兩邊夾殺下死的就是路邊的NVIDIA了。

  10. amdzone上有一段Chuck Moore的演講
    其中有一段是
    Bulldozer module is not bigger in area than Intel’s hyperthreading design
    可以理解為,Bulldozer的Module面積不大于sandy bridge的Core吧

  11. >>可以理解為,Bulldozer的Module面積不大于
    >>sandy bridge的Core吧
    根據Chiphell那張圖
    如果以Bulldozer預估1B電晶體來看,假設1B是正確的.
    四核CPU+L2 Cache佔不到一半面積.
    也就是頂多500M,這明顯比Core2Quad,i7都小.
    Bulldozer單核性能應該會輸Sandy Bridge.
    畢竟Sandy Bridge把大部分面積都用在CPU和Cache,
    但是Sandy Bridge的四核含Cache起碼800M以上.
    (連i7都要700多M了)
    對Bulldozer來說,CPU CORE面積只有對手的2/3.
    所以不必追求”單核”效能同級,也會有競爭力.
    以單核效率來說雖然比不上Intel的SMT.
    但是以thread的效率來看,卻比較高.
    因為每個Thread都有自己的運算單位,不是虛擬的Core.
    在4核以上的市場,一般軟體Thread有限的情形下,
    這設計未來反而更有機會.
    至於GPU, Chiphell那張圖顯示的非常清楚,
    再參考一下http://i31.tinypic.com/1t5z13.jpg
    的Shader單位 & Tex單位的構造圖,及RV770的現有規格.
    可以確定Llano的內建GPU規格了.
    上方6組是材質單位是24Tex, 下方12組SIMD單位是240SP.
    (不知道圖下面還有沒有被切掉,目前看到12組)
    照比例推測ROP應該會是6~8個,使用128bit頻寬很ok.
    以面積看大約估計GPU部分是500M電晶體,
    使用了32nm製程,時脈應可以跑的比RV730高,
    只是不知道Bulk變成SOI製程的差異對GPU性能有多少幫助.
    也許能輕鬆超過1Ghz?
    我想可以保守期待它至少有RV730等級的效能
    以及DX11的規格.
    如果Sandy Bridge開SMT用dual-core來低價亂灑.
    AMD應該把Bulldozer用1個雙核模組+更低階顯示來賣.
    拿RV710丟進去就好了,這樣恐怕只要100mm2.
    反正賣的是整個solution,CPU輸的就從GPU贏回來…..
    連RV620都可以慘電Intel的內顯,RV710應該還可領先幾年.

  12. chiphell那張圖是AMD Liano吧? 那麼CPU core應該是K10而不是Bulldozer….所以應該是完全打不著關係。
    1B電晶體是從ixbt來的,然後die photo再用chiphell那張來推,結果好像會蠻混亂的….
    不過K10 core的確是本來就比Nehalem和Sandy Bridge來得小,所以去掉Bulldozer搞混的部分,大部分的預估應該沒問題才對。
    至於Bulldozer能不能用上Fusion這個CPU+GPU共用的記憶體介面有待觀察,大概等個一代比較安全….
    K10 4core和sandy bridge-DT說不定根本差不多大。
    然後更低價的市場說不定AMD就直接拿bobcat+64bit DDR3去搭RV710了吧….

  13. AthlonX4的晶體管只有3億多,加上2MB的L2算4億好了,這部分占整個Llano小一半的話,整個Llano大約10億還是可信的。

  14. 如果我們稍微看遠一點的
    4年後的22nm,core面積又要再縮小一次.
    這次4核心主流CPU含快取大概只有50mm2.
    (相當於目前45nm雙核Atom的尺寸.)
    如果不塞進其他晶片把處理器”做大”,
    小CPU本身的利潤會非常低.
    以製程切割經濟尺寸200mm2來推算,
    22nm將會空出150mm2左右的面積
    如果整合150mm2左右的強力GPU變成內顯.
    “獨顯”的存在價值就很尷尬.
    因為150mm2已經踩進了傳統中高階GPU的領域.
    大概是HD4770~HD5750的等級,
    到時候80%的用戶已經不需要再買獨顯.
    雖然GPU需求還是持續成長,但”獨顯”的市場萎縮
    可以預見了, 這可能是之前沒想到的.

    NV手上還沒有X86…..這幾年可能是關鍵.
    ARM和HPC的市場不夠大,還是要想辦法弄到X86入場券.
    大家都在搞整合處理器,NV幾年後若沒有辦法
    提出完整Solution , 也許連單獨賣GPU的機會也沒有.

  15. 32nm的bulldozer 4m/8c多半是200mm^2附近,到了22nm就正好100mm^2,然后塞個100mm^2級別的GPU。
    到了16nm的時候嘛,我估計,FINAL FUSION也該出來了,不是CPU+GPU的異構fusion而是同構fusion。

  16. 其實我覺得不必想的這麼遠,先觀望一下Intel快要正式發表的dual core Westmere + Ironlake。
    我曾經想過,如果Intel能讓NVIDIA提供GMCH,dual core Westmere + NVIDIA的solution搞不好真的很有競爭力,不過現在看來都是狂想曲了。
    總而言之,AMD已經撐過併購ATI的陣痛期,剩下就看他們的執行力和成本控制能耐了。假如Llano的「完整版」die photo不是假的,看來也不會是太便宜的東西…

  17. 小弟離題請教一下,1.現在的CPU/GPU動不動就幾千萬個電晶體,這麼多的數量,要怎麼檢測呀?還是生產時就可以用機器檢測出來??
    2.如果其中壞了一個,那就整個報銷嗎??謝謝

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *

這個網站採用 Akismet 服務減少垃圾留言。進一步了解 Akismet 如何處理網站訪客的留言資料