千呼萬喚始出來~~~
連阿嬤都會喝手沖咖啡順便學AIGC系列
~小白老師本地免費生成式AI爽爽用到飽保證班
阿嬤班報名表:
https://forms.gle/tG3D1JXKj2ayu8tg6
第一堂:(請自備電腦及固網)
簡單美味手沖咖啡起手式
無痛上手本地AIGC─設計免費無限使用班級學習角(Jan AI )
時間與鏈結將於開課前在課堂內及以郵件發送
千呼萬喚始出來~~~
連阿嬤都會喝手沖咖啡順便學AIGC系列
~小白老師本地免費生成式AI爽爽用到飽保證班
阿嬤班報名表:
https://forms.gle/tG3D1JXKj2ayu8tg6
第一堂:(請自備電腦及固網)
簡單美味手沖咖啡起手式
無痛上手本地AIGC─設計免費無限使用班級學習角(Jan AI )
時間與鏈結將於開課前在課堂內及以郵件發送
最便宜礦卡大約台幣$1200,這片是全新貼片的約台幣$1800,本來期待他的16G 版本,但這篇測完後發現好險沒買。
因為很顯然,雖然是AMD經典礦卡,但他不支援ROCm技術(可以安裝但不支援,官網還是比較準),因此大部分的GPT(Jan、lm-studio、Ollama+Chatbox、Ollama) 沒辦法用GPU跑,不管是否有抓到顯卡,調動Vulkan技術(有load進VRAM,但GPU 沒有跑起來,這跟老黃的NVIDIA沒有安裝CUDA是一樣的狀況,唯一例外是GPT4ALL可以調動顯卡的GPU跑起來,但速度也只有 11 token/s,這比純用CPU跑(3-7 token/s)並沒有高多少,甚至比新型的帶NPU 或是多核CPU 還要低。
況且,以StabilityMatrix裡面的各種Stable Diffusion 生圖套件的支援度,大部分都不行,應該是AMD僅支援linux來玩SD,Windows 下我裝了幾種都不能跑,甚至不能啟動,才明白他的支援列表 “AMD(Linux)” 是這個意思,顯然從支援列表上Intel arc應該更有機會,但AMD RX6600 XT以上支援ROCm部分待測,我就不敢斷定。
所以,如果你的電腦比 intel i5 八代以上還新,建議放棄這張卡,雖然他是8G VRAM 最便宜的顯卡。
低價就是王道,至少他使用GPT4ALL還能玩得動7B~9B 的大模型,可以跑到 11 token/s,如果是我,我應該會設定成班級教室的學習角落,做一個專業的教練,讓學生訓練專門的能力,或課輔的幫手。
再者,這張卡片目前仍舊是遊戲領域1080P的低價CP值之王 ,在furmark的測試下,每秒還能到 42 FPS,一般的遊戲是沒有問題的,就是剪輯部分因為編碼缺乏intel優勢比較弱。
而且,他還能讓舊電腦效能稍微加強,還能當我維修用的亮機卡,還有Linux的支援向來是AMD的天下,因此也是舊電腦翻身變成高效Ubuntu系統的助力選手。
緣由:
| 特性 | CUDA | ROCm | oneAPI |
| 主要開發商 | NVIDIA | AMD | 多家廠商共同開發 (包含 Intel, AMD, Google 等) |
| 支援硬體 | NVIDIA GPU | AMD GPU | 多種加速器 (包含 GPU, CPU, FPGA) |
| 程式語言 | C/C++, Fortran | C/C++, Fortran | C/C++, Fortran, Python 等多種語言 |
| 開發工具 | CUDA Toolkit | HIP (Heterogeneous-core Interface for Portability) | DPC++ (Data Parallel C++) |
| 生態系 | 最為成熟,擁有龐大的開發者社群和豐富的第三方函式庫 | 生態系正在快速發展,但相較於 CUDA 較小 | 正在積極發展中,目標是建立一個統一的異質運算開發平台 |
| 跨平台性 | 主要針對 NVIDIA 平台,但部分功能可跨平台 | 主要針對 AMD 平台,但部分功能可跨平台 | 強調跨平台性,可針對不同硬體進行編譯和優化 |
| 優勢 | 生態系成熟、性能優異 | 針對 AMD GPU 優化良好、開放原始碼 | 跨平台性強、未來發展潛力大 |
| 劣勢 | 跨平台性較弱、生態系相對封閉 | 生態系較小、開發工具相對不成熟 | 生態系仍在發展中、工具鏈可能不完善 |
顯卡跑LLM速度大約是如何呢?( 參照RTX4080)
4080是張16G的顯卡,從官網Qwen的測試看來,從7B的版本看起來速度可以達到124tok/sec,大約是4060的3倍,而顯卡天梯上,4080效能也差不多是4060的3倍左右,所以可以估算,模型在不超過VRAM的容量下,大約就是這樣的比例,
我的4060經實際測試大約是47 tok/sec
因此4070大約會落在70 tok/sec左右
至於超過VRAM之後,速度就會掉得很可怕了
以下是實測的結果,電腦10900/64G 顯卡4060/8G
QWEN2.5 7B/14B (Q4)用 lm-studio平台,在不同型號顯卡大家的速度是多少tokens/sec?
4060→7B:46.9tok/sec(極為順暢)
4060→14B:3.92tok/sec (約需要11G VRAM,顯然已經超過顯卡8G VRAM,速度降得很誇張)
高階顯卡部分感謝金門王家駿教授、陳文舟老師助測:
4090/16G筆電(MSI Raider 18 HX A14V筆電 4090/16GB,RAM 32GB)
4090→7B:69.14tok/sec(極為順暢)
TITAN Xp/12G→7B:46.46 tokens/s(極為順暢)
4090→14B:39.57tok/sec(極為順暢)
4090→32B:4.19tok/sec(需要約22G VRAM已經超過,降速離譜)
4090→70B(llama3.3)無法運行(需要45G VRAM才能跑)
因此,對於一般學習者而言,不牽涉其他AI服務的話,桌面版 4060Ti/16G無疑是平衡下的最佳選擇,而對於要玩AI生圖的人,還是攻頂比較合適,是生產力效率的問題
換句話說:如果你想順跑Qwen2.5 7BQ4 的模型,其實6G/8G顯卡就能順跑,所以如果你是GTX1060/6G 其實也不用換,但是若想跑順跑 14B 的模型,就得買VRAM 有12G的顯卡
以下圖片為官網提供測試的結果
─文章榮登科學研習雙月刊第63卷第4期
https://www.ntsec.gov.tw/article/detail.aspx?a=5562
PodCast用聽的
我到底要買多大VRAM的顯卡才能順順玩llm
朋友常常問我這個問題,以阿里巴巴通譯千問2.5的模型來看
如果你使用的是7B參數量的模型,
模型容量是4.7GB通常導入VRAM記憶體之後會再增加個1到2G
所以這個7B的模型在VRAM有6G的顯示卡上面應該是可以順跑的
因此,不管你用的是1060/6G還是3050/4060/6G,順順跑應該都還沒問題
但是一旦VRAM不夠使用,模型部分載入本機記憶體的話體
體感速度就會降10倍
| 公司 | 型號 | TOPS (FP8) | VRAM | 台幣參考售價 | 備註 |
|---|---|---|---|---|---|
| NVIDIA | RTX 4090 | 1,321 | 24GB GDDR6X | 65,000 | 最強消費級顯卡 |
| NVIDIA | RTX 4080 Super | 1,000 | 16GB GDDR6X | 39,900 | |
| NVIDIA | RTX 4080 | 780 | 16GB GDDR6X | 38,900 | |
| NVIDIA | RTX 4070Ti Super | 670 | 16GB GDDR6X | 32,900 | |
| AMD | RX 7900 XTX | 650 | 24GB GDDR6 | 39,900 | AMD旗艦卡 |
| NVIDIA | RTX 4070Ti | 580 | 12GB GDDR6X | 29,900 | |
| AMD | RX 7900 XT | 520 | 20GB GDDR6 | 35,900 | |
| NVIDIA | RTX 4070 Super | 480 | 12GB GDDR6X | 24,900 | |
| Intel | Arc A770 | 450 | 16GB GDDR6 | 11,900 | Intel首發旗艦卡 |
| NVIDIA | RTX 4070 | 420 | 12GB GDDR6X | 22,900 | |
| AMD | RX 7800 XT | 400 | 16GB GDDR6 | 23,900 | |
| AMD | RX 7700 XT | 380 | 12GB GDDR6 | 19,900 | |
| Intel | Arc A750 | 340 | 8GB GDDR6 | 9,900 | |
| NVIDIA | RTX 4060Ti | 310 | 8GB/16GB GDDR6 | 15,900/17,900 | |
| NVIDIA | RTX 4060 | 280 | 8GB GDDR6 | 12,900 | |
| AMD | RX 7600 | 250 | 8GB GDDR6 | 10,900 | |
| Intel | Arc A580 | 240 | 8GB GDDR6 | 7,900 | |
| NVIDIA | RTX 3060Ti | 220 | 8GB GDDR6 | 11,900 | 上代中階卡 |
| NVIDIA | RTX 3060 | 180 | 12GB GDDR6 | 9,900 | |
| Intel | Arc A380 | 150 | 6GB GDDR6 | 4,900 | |
| NVIDIA | RTX 3050 | 140 | 8GB GDDR6 | 8,900 | |
| AMD | RX 6500 XT | 130 | 4GB GDDR6 | 5,900 | |
| Intel | Core Ultra 7 285H | 80 | 共享系統記憶體 | - | Intel最強筆電APU |
| Intel | Core Ultra 7 165H | 75 | 共享系統記憶體 | - | |
| Intel | Core Ultra 5 125H | 70 | 共享系統記憶體 | - | |
| AMD | Ryzen 8845HS | 65 | 共享系統記憶體 | - | AMD最新筆電APU |
| AMD | Ryzen 7840HS | 60 | 共享系統記憶體 | - | |
| AMD | Ryzen 7835HS | 55 | 共享系統記憶體 | - | |
| Apple | M3 Ultra | 50 | 共享系統記憶體 | - | Apple最強晶片 |
| Apple | M3 Pro | 40 | 共享系統記憶體 | - | |
| Apple | M3 | 35 | 共享系統記憶體 | - | |
| Apple | M2 | 30 | 共享系統記憶體 | - | |
| Apple | M1 | 25 | 共享系統記憶體 | - |