[閒聊] 洋垃圾低價雙卡AI主機跑Qwen3.6笑能分享

看板PC_Shopping作者 (ck203l5)時間1周前 (2026/07/24 03:16), 編輯推噓15(15026)
留言41則, 18人參與, 1周前最新討論串1/1
2026年堪稱 迴光返照 文藝復興 的重大紀元 只因為AI讓大家都快買不起新電腦 導致什麼奇形怪狀的舊3C零件都能被挖出來重新上架還賣得嚇嚇叫 俗話說 AI主機沒撇步 鈔票砸下去就有 在這個砸大錢就有高效能的時代 來分享一下買不起新零件的窮人AI機笑能供各位板友參考 本次用前陣子特價的 RX9060XT 16G 搭配舊硬體進行測試 ********固定設備******** 顯示卡: 2張 RX9060XT 16G LLM: qwen3.6:27b-q4_K_M Docker: Ollama KV-Cache量化: q_8 Context Window: 64K Parallelism: Pipeline Parallelism 流水線並行 ********設備1******** CPU: E5-2673 V3 RAM: DDR3-1600L 32GB Dual-CH MB: HUANANZHI X99 CD3 NAME ID SIZE PROCESSOR CONTEXT UNTIL qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever total duration: 1m14.1222733s load duration: 530.1327ms prompt eval count: 12 token(s) prompt eval duration: 368.881ms prompt eval rate: 32.53 tokens/s eval count: 965 token(s) eval duration: 1m13.191813s eval rate: 13.18 tokens/s https://i.meee.com.tw/DzRAxhW.png
https://i.meee.com.tw/etWE5Yx.jpg
https://i.meee.com.tw/gkkB4tA.jpg
********比較設備2******** CPU: E5-2690 V4 RAM: DDR4-2400 32GB Quad-CH MB: 白牌山寨 X99 NAME ID SIZE PROCESSOR CONTEXT UNTIL qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever total duration: 1m26.1562391s load duration: 463.7373ms prompt eval count: 12 token(s) prompt eval duration: 349.873ms prompt eval rate: 34.30 tokens/s eval count: 1128 token(s) eval duration: 1m25.335511s eval rate: 13.22 tokens/s https://i.meee.com.tw/HUECTE0.png
********比較設備3******** CPU: R9-5900X RAM: DDR4-3200 64GB Dual-CH MB: ASRock B550M-ITX/AC + PCI-E通道分割設備 NAME ID SIZE PROCESSOR CONTEXT UNTIL qwen3.6:27b-q4_K_M a50eda8ed977 19 GB 100% GPU 65536 Forever total duration: 41.5421257s load duration: 225.8911ms prompt eval count: 12 token(s) prompt eval duration: 323.544ms prompt eval rate: 37.09 tokens/s eval count: 565 token(s) eval duration: 40.97805s eval rate: 13.79 tokens/s https://i.meee.com.tw/TWK9EQo.png
********小結******** https://www.reddit.com/r/LocalLLM/comments/1szvz9q/qwen3627b_q3_k_s_on_rx_9060_xt_16gb_decent/ 有Reddit上的網友用 [ R9-7950X, 64GB DDR5, RX9060XT 16G, ROCm, llama.cpp ] 跑qwen3.6:27b-q3_K_S, 12288 context, Full GPU offload, KV-Cache q_4, 14.8GB VRAM Used <<速度大概是 14 tok/s>> 本次測試用 [ E5-2673V3, 32GB DDR3, RX9060XT 16G X2, Ollama(llama.cpp核心)] 跑qwen3.6:27b-q4_K_M, 65536 context, Full GPU offload, KV-Cache q_8, 19GB VRAM Used <<速度大概是 13~14 tok/s>> <比較點> 1.跑q4_K_M理論上較q3_K_S慢 2.跑64K q8-KV理論上較12K q4-KV慢 3.雙卡跑Pipeline Parallelism (流水線並行)只會比單卡慢不會更快 令人欣慰的是實際跑出來速度沒有慢很多。 但對於RX9060XT這種記憶體頻寬只有320.0 GB/s的顯示卡來說,在Full GPU offload情況 下,換好的CPU或記憶體效能提升似乎有限? ********個人心得******** 雖然13~14 tok/s的"笑能"對5070Ti或是5090的卡來說就是個笑話, 但用手邊現有的DDR3記憶體&舊SSD,整套設備大概花1015出頭USD(國內買會更便宜),且9 成預算的零件是能直接挪用到其他電腦, 就能有一台有32G VRAM的AI主機,算是頗划算的了,雖然速度真的有點慢就是了~ CPU: 15 USD MB: 65 USD RAM: 0 (現有) GPU: 850 USD SSD: 0 (現有) POWER: 35 USD CASE: 50 USD Total: 1015 USD 分享給手邊已有大容量舊記憶體、不想花大錢又想玩AI的板友~ ********預算充足能買整台DDR5新電腦的請不要用這種零件折磨自己******** ****本篇內容僅為個人測試心得,若論點或觀點有誤還請各位多幫忙指正或分享資訊**** 順便分享一下本月剛發布的 LM Studio Bionic 引擎, 用這台設備已能在地端用開源權重模型直接運行自動化AI任務, 它能自己調用工具讀取檔案,分析後自動產製一份Word報告文件(雖然整個要花12分鐘有 點慢就是了)。 https://i.meee.com.tw/yDOXE1x.png
https://i.meee.com.tw/NHKdk8K.png
https://i.meee.com.tw/JyfLBHg.png
感謝您的收看~ -- ※ 發信站: 批踢踢實業坊(ptt.cc), 來自: 12.170.106.26 (美國) ※ 文章網址: https://www.ptt.cc/bbs/PC_Shopping/M.1784834166.A.837.html

07/24 03:18, 1周前 , 1F
MTP尬下去可以x1.8吧
07/24 03:18, 1F

07/24 03:23, 1周前 , 2F
沒想到9060xt跟395+差不多,MTP下去395大約
07/24 03:23, 2F

07/24 03:23, 1周前 , 3F
20T/s (Q4)
07/24 03:23, 3F

07/24 03:37, 1周前 , 4F
關鍵還是顯卡吧
07/24 03:37, 4F

07/24 03:42, 1周前 , 5F
重點是便宜
07/24 03:42, 5F

07/24 05:07, 1周前 , 6F
這幾天也弄了台X99+4卡3060 12G花約3萬元
07/24 05:07, 6F

07/24 05:09, 1周前 , 7F
Qwen3.6 27B Q8+MTP+多模+128K context
07/24 05:09, 7F

07/24 05:10, 1周前 , 8F
prefill 836t/s,decode 48t/s
07/24 05:10, 8F

07/24 05:13, 1周前 , 9F
llama.cpp跑--split-mode tensor
07/24 05:13, 9F

07/24 07:50, 1周前 , 10F
那樣395+反而是好的那邊吧
07/24 07:50, 10F

07/24 08:20, 1周前 , 11F
一般家用重點還是顯存 要先跑得起來
07/24 08:20, 11F

07/24 08:27, 1周前 , 12F
幫他找個鞋盒吧
07/24 08:27, 12F

07/24 08:37, 1周前 , 13F
推分享 X99平台還在發力
07/24 08:37, 13F

07/24 09:22, 1周前 , 14F
別再用ollama惹 改用llama.cpp
07/24 09:22, 14F

07/24 09:22, 1周前 , 15F
參數調一下應該還能更快
07/24 09:22, 15F

07/24 09:46, 1周前 , 16F
395開mtp大概20tps但是限代碼生成
07/24 09:46, 16F

07/24 10:52, 1周前 , 17F
不考慮張量並行嗎
07/24 10:52, 17F

07/24 10:56, 1周前 , 18F
主板pcie太舊 開張量並行會悲劇
07/24 10:56, 18F

07/24 11:05, 1周前 , 19F
我測過3060兩張跑pcie 3.0 x16,用--sm
07/24 11:05, 19F

07/24 11:05, 1周前 , 20F
tensor後從--sm layer的27t/s提升到45t/
07/24 11:05, 20F

07/24 11:05, 1周前 , 21F
s
07/24 11:05, 21F

07/24 11:08, 1周前 , 22F
再測試頻寬降到PCIe 2.0 x16,速度只降
07/24 11:08, 22F

07/24 11:08, 1周前 , 23F
到44t/s
07/24 11:08, 23F

07/24 11:18, 1周前 , 24F
想追性能就真的別用ollama了
07/24 11:18, 24F

07/24 12:43, 1周前 , 25F
進入AI時代了 真的很缺跑得快的電腦
07/24 12:43, 25F

07/24 15:02, 1周前 , 26F
換掉ollama+1,雙卡不要用這個應該會更好,
07/24 15:02, 26F

07/24 15:02, 1周前 , 27F
然後bios有above 4G選項的話記得開,resize
07/24 15:02, 27F

07/24 15:02, 1周前 , 28F
bar應該是不會有,沒得用
07/24 15:02, 28F

07/24 16:26, 1周前 , 29F
舊MB就盡量找有x16 pcie的卡,找x8的頻寬會
07/24 16:26, 29F

07/24 16:26, 1周前 , 30F
直接腰斬,洋垃圾基本上不太需要擔心pcie的
07/24 16:26, 30F

07/24 16:26, 1周前 , 31F
Lane 不夠用
07/24 16:26, 31F

07/24 19:10, 1周前 , 32F
我覺得問題是Ollama
07/24 19:10, 32F

07/24 19:10, 1周前 , 33F
我4060ti只有16G跑個Qwen 3.6 35B,K
07/24 19:10, 33F

07/24 19:10, 1周前 , 34F
V雙Q4都只比你慢5Tokens/s
07/24 19:10, 34F

07/24 19:10, 1周前 , 35F
而我的軟體平台是LM Studio
07/24 19:10, 35F

07/24 19:25, 1周前 , 36F
35B是MoE架構,跟dense的27B比速度基準不一
07/24 19:25, 36F

07/24 19:25, 1周前 , 37F
樣啦,35B用只有12G的4070ti offload都還有
07/24 19:25, 37F

07/24 19:25, 1周前 , 38F
20toks以上了
07/24 19:25, 38F

07/24 21:09, 1周前 , 39F
CPU PCIE的通道太舊了 隨便換個epyc會好
07/24 21:09, 39F

07/24 21:09, 1周前 , 40F
一點 epyc洋垃圾的生態也滿健康的
07/24 21:09, 40F

07/24 21:11, 1周前 , 41F
gen4 雙16 的主板 會有點貴就是
07/24 21:11, 41F
文章代碼(AID): #1gOcXsWt (PC_Shopping)