2024年12月19日 星期四

連阿嬤都會喝手沖咖啡順便學AIGC系列(免費無痛保證班)

 千呼萬喚始出來~~~

連阿嬤都會喝手沖咖啡順便學AIGC系列

~小白老師本地免費生成式AI爽爽用到飽保證班

阿嬤班報名表:

https://forms.gle/tG3D1JXKj2ayu8tg6

第一堂:(請自備電腦及固網)

簡單美味手沖咖啡起手式

無痛上手本地AIGC─設計免費無限使用班級學習角(Jan AI )

時間與鏈結將於開課前在課堂內及以郵件發送



2024年12月16日 星期一

全網最詳細評測:用翻新經典礦卡AMD RX580/8G (非NVIDIA顯卡) 挑戰LLM本地AIGC(ChatGPT) 跑本地大模型

用AMD RX580/8G (非NVIDIA顯卡) 挑戰LLM本地AI

我先講結論:

“大家都知道,玩LLM最好買老黃N卡”

作為CP值教主,測試完之後我的建議是:

  • 如果你不是很舊的電腦,建議不要買RX580,(但RX6600 XT以上待測)

最便宜礦卡大約台幣$1200,這片是全新貼片的約台幣$1800,本來期待他的16G 版本,但這篇測完後發現好險沒買。

因為很顯然,雖然是AMD經典礦卡,但他不支援ROCm技術(可以安裝但不支援,官網還是比較準)因此大部分的GPT(Jan、lm-studio、Ollama+Chatbox、Ollama) 沒辦法用GPU跑,不管是否有抓到顯卡,調動Vulkan技術(有load進VRAM,但GPU 沒有跑起來,這跟老黃的NVIDIA沒有安裝CUDA是一樣的狀況,唯一例外是GPT4ALL可以調動顯卡的GPU跑起來,但速度也只有 11 token/s,比純用CPU跑(3-7 token/s)並沒有高多少,甚至比新型的帶NPU 或是多核CPU 還要低。

況且,以StabilityMatrix裡面的各種Stable Diffusion 生圖套件的支援度,大部分都不行,應該是AMD僅支援linux來玩SD,Windows 下我裝了幾種都不能跑,甚至不能啟動,才明白他的支援列表 “AMD(Linux)” 是這個意思,顯然從支援列表上Intel arc應該更有機會,但AMD RX6600 XT以上支援ROCm部分待測,我就不敢斷定。

所以,如果你的電腦比 intel i5 八代以上還新,建議放棄這張卡,雖然他是8G VRAM 最便宜的顯卡。

  • 但如電腦很舊不想花大錢,不考慮可能買到短命卡,蠻建議這張礦卡。

低價就是王道,至少他使用GPT4ALL還能玩得動7B~9B 的大模型,可以跑到 11 token/s,如果是我,我應該會設定成班級教室的學習角落,做一個專業的教練,讓學生訓練專門的能力,或課輔的幫手

再者,這張卡片目前仍舊是遊戲領域1080P的低價CP值之王 ,在furmark的測試下,每秒還能到 42 FPS,一般的遊戲是沒有問題的,就是剪輯部分因為編碼缺乏intel優勢比較弱

而且,他還能讓舊電腦效能稍微加強,還能當我維修用的亮機卡,還有Linux的支援向來是AMD的天下,因此也是舊電腦翻身變成高效Ubuntu系統的助力選手。

  •  大家都知道,玩大模型最好買老黃N卡,這句是對的。

以下是測試的歷程 

緣由:


為尋找可以玩LLM的最低配置方案,經過一陣子的知識巡禮後,我買了這張RX580/8G顯卡,這是挖礦時代的卡片,不過這張卡除了核心晶片應該是礦卡搬過來的以外,其餘所有的零件包含電路板都是全新的,售價含運及關稅大約是台幣$1860,比真正礦卡貴了約800但是比較不會踩雷,但其實我更想買的是他們魔改的一張RX580/16G(但售價是雙倍)。

我知道玩AI需要老黃的NVIDIA,因為Cuda的支援比較豐富,而AMD則需要支援ROCm比較沒問題,但支援ROCm的都是RX6600XT以上的顯卡,那就失去我尋求最低配置方案的意義,而老黃的顯卡即使是二手的也是偏貴,更何況是8G以上的中階顯卡;而我也是要順便測試一下,即使未能支援Cuda/ROCm的顯卡,能比純CPU跑LLM快多少,來判斷是否值得。

我其實也考慮過M40,但那功率實在太高,而且支援Cuda的結果我也知道,網路上也有人測過跑中等模型的速度,跑起來跟用CPU跑差不多(5-7 token/s),因此多測無異。

我買的是稍貴的 新貼片生產的RX580/8G/雙風扇/3接口(DVI/HDMI/PD)版本,剛好有一台舊主機無顯卡,因此就算不玩LLM,至少還能給這台主機用或是做亮機卡,或是留著日後測試Oculink外接顯卡。



我其實比較想買16G 魔改那片,但沒買過不確定能用就不想花太多錢(還好後來沒買)


盒子包裝得很好,泡綿也很厚


卡況確定是全新貼片生產的 所有零件都是新的,除了主晶片


有 DVI/HDMI/DP 三個不同的 PORT


規格大約是 150~185W / 2048 Cuda流處理器 / 約等同 GTX-1060 / RX-5500XT 的水準
驅動程式也是使用AMD官網的驅動程式,所以驅動程式更新也不會有問題


從維基百科看來 RX580 是有支援 ROCm 的
但是根據官方網站的說法,是RX6600以上才支援,這裡明顯有矛盾

參考:原則上玩AI大模型 顯卡支援性與環境需求
特性CUDAROCmoneAPI
主要開發商NVIDIAAMD多家廠商共同開發 (包含 Intel, AMD, Google 等)
支援硬體NVIDIA GPUAMD GPU多種加速器 (包含 GPU, CPU, FPGA)
程式語言C/C++, FortranC/C++, FortranC/C++, Fortran, Python 等多種語言
開發工具CUDA ToolkitHIP (Heterogeneous-core Interface for Portability)DPC++ (Data Parallel C++)
生態系最為成熟,擁有龐大的開發者社群和豐富的第三方函式庫生態系正在快速發展,但相較於 CUDA 較小正在積極發展中,目標是建立一個統一的異質運算開發平台
跨平台性主要針對 NVIDIA 平台,但部分功能可跨平台主要針對 AMD 平台,但部分功能可跨平台強調跨平台性,可針對不同硬體進行編譯和優化
優勢生態系成熟、性能優異針對 AMD GPU 優化良好、開放原始碼跨平台性強、未來發展潛力大
劣勢跨平台性較弱、生態系相對封閉生態系較小、開發工具相對不成熟生態系仍在發展中、工具鏈可能不完善

測試設備:



CPU i5-8400 6核心
記憶體 16G 雙通道
系統碟 512 SSD
顯卡 RX 580顯卡 安裝原廠AMD驅動
Power 550W 

Ubuntu開機超順暢
Windows安裝及驅動安裝完全沒問題,就是更新等了很久
確定是 RX580 8G
lm-studio 使用 Qwen2.5 7B 模型,可以完全載入VRAM,但是GPU看似並無運作,速度6.3 token/s
Furmark測試5分鐘最多跑到72度/42FPS,溫度控制很可以,風扇也很安靜
lm-studio 使用 llama3.2 3B 模型,可以完全載入VRAM,但是GPU看似為微幅運作,大部分運作的還是CPU,速度來到11.8 token/s,第二次測是 7.08 token/s,第三次是10.38 token/s
Jan ai 抓不到顯卡 用CPU運作
Jan ai 開啟 Experimenttal Mode 後 就能開啟 Vulkan 支援,這時可以看到顯卡可支援
Jan ai 模型可以載入VRAM ,但GPU毫不配合運作,都只有CPU上工,速度6-7token/s
GPT4ALL 可以抓到支援Vulkan 的RX580
GPT4ALL 測 llama 3B小模型,可以載入RAM,GPU跑起來了,CPU也配合運作,速度達到最快時13 token/s,看來GPT4ALL 可以讓CPU/GPU高度協同
補安裝AMD ROCm支援
GPT4ALL 使用llama3 8B中模型,在安裝了AMD ROCm支援後,GPU終於跑滿檔,令人興奮,速度11 token/s
Jan 回頭測試,GPU仍然不動如山
換成ollama+chatbox,GPU仍然不動如山

結論:

  1. RX580果然不支援ROCm,但GPT4ALL是例外。
  2. 使用GPT4ALL時GPU 可全速運作,速度11 token/s,比新的CPU稍好而已。
  3. 除非是電腦很舊,只想花最少的錢讓她勉強玩一下LLM才值得。
  4. 特殊單一用途,例如設定來當學習角,中型模型用起來還是很棒。
  5. 很新的電腦,用CPU都會跑得比他快。
  6. SD生圖在windows底下RX580大多不支援。
  7. RX6600XT以上支援ROCm,要測試過才知道AMD全系列顯卡在LLM上的支援度。
  8. 不看LLM的話,RX580仍是亮機測試卡、爛老電腦遊戲提高效能最便宜高CP選擇。
  9. 我猜intel arc(比較新) 支援度可能更好,老黃的卡實在太貴了。
  10. AMD老顯卡推薦用GPT4ALL 來玩LLM。

本次測試,花掉我的薪水$1860元

2024年12月2日 星期一

顯卡跑LLM速度大約是如何呢?( 參照RTX4080)

顯卡跑LLM速度大約是如何呢?( 參照RTX4080)

4080是張16G的顯卡,從官網Qwen的測試看來,從7B的版本看起來速度可以達到124tok/sec,大約是4060的3倍,而顯卡天梯上,4080效能也差不多是4060的3倍左右,所以可以估算,模型在不超過VRAM的容量下,大約就是這樣的比例,

我的4060經實際測試大約是47 tok/sec

因此4070大約會落在70 tok/sec左右

至於超過VRAM之後,速度就會掉得很可怕了

以下是實測的結果,電腦10900/64G 顯卡4060/8G

QWEN2.5 7B/14B (Q4)用 lm-studio平台,在不同型號顯卡大家的速度是多少tokens/sec?

4060→7B:46.9tok/sec(極為順暢)

4060→14B:3.92tok/sec (約需要11G VRAM,顯然已經超過顯卡8G VRAM,速度降得很誇張)

高階顯卡部分感謝金門王家駿教授、陳文舟老師助測:

4090/16G筆電(MSI Raider 18 HX A14V筆電 4090/16GB,RAM 32GB)

4090→7B:69.14tok/sec(極為順暢)

TITAN Xp/12G→7B:46.46 tokens/s(極為順暢)

4090→14B:39.57tok/sec(極為順暢)

4090→32B:4.19tok/sec(需要約22G VRAM已經超過,降速離譜)

4090→70B(llama3.3)無法運行(需要45G VRAM才能跑)

因此,對於一般學習者而言,不牽涉其他AI服務的話,桌面版 4060Ti/16G無疑是平衡下的最佳選擇,而對於要玩AI生圖的人,還是攻頂比較合適,是生產力效率的問題

換句話說:如果你想順跑Qwen2.5 7BQ4 的模型,其實6G/8G顯卡就能順跑,所以如果你是GTX1060/6G 其實也不用換,但是若想跑順跑 14B 的模型,就得買VRAM 有12G的顯卡

以下圖片為官網提供測試的結果


至於對岸便宜的礦卡8G礦卡,等我買回來再測給大家看

若是不用顯卡,純用CPU跑(GPU OFFLOAD),跑Qwen2.5 7BQ4,速度是
在17-8700K(6核12緒):5.85 toks/s (速度很慢)

其他網友的測量
Kevin Chen:顯卡GTX1060/6GB (Qwen2.5 7b)→ 11.88 tokens/s
RX580/8G  (Qwen2.5 7b/Gemma2 9B,使用GPT4ALL)→ 6~11 tokens/s
M3 pro 18G 測qwen2.5 "3B" 速度達53token/s /7B未測試/32B無法載入需要再確認

也歡迎大家協助檢測提供數據

2024年11月26日 星期二

賀!是你控制了GAI?還是GAI控制了你?AIGC時代的上位思考─文章榮登科學研習雙月刊第63卷第4期

是你控制了GAI?還是GAI控制了你?
AIGC時代的上位思考

    ─文章榮登科學研習雙月刊第63卷第4期



期刊全文檔案鏈結在下方

https://www.ntsec.gov.tw/article/detail.aspx?a=5562

PodCast用聽的




2024年11月21日 星期四

我到底要買多大VRAM的顯卡才能順順玩llm

我到底要買多大VRAM的顯卡才能順順玩llm

朋友常常問我這個問題,以阿里巴巴通譯千問2.5的模型來看

如果你使用的是7B參數量的模型,

模型容量是4.7GB通常導入VRAM記憶體之後會再增加個1到2G

所以這個7B的模型在VRAM有6G的顯示卡上面應該是可以順跑的

因此,不管你用的是1060/6G還是3050/4060/6G,順順跑應該都還沒問題

但是一旦VRAM不夠使用,模型部分載入本機記憶體的話體

體感速度就會降10倍

因此如果你想順跑14 B參數的模型
可能就要買到3060/4070/12G或者4060ti/16G以上
想跑32B參數的模型就只能買4090/24G了

但如果你是Mac因為他是共用記憶體架構
因此幾乎大部份的記憶體都可以調用作為VRAM
24G RAM 的Mac應該就可以順跑32B的模型
這是Mac 在LLM領域CP值比較高的原因
不過因為顯示晶片的效能還是不敵獨立顯卡所以速度當然沒有獨立顯卡快

那接下來你就會文32B參數跟14B參數的模型到底有什麼差別
其實就是聰明度的差別從下面這張圖看起來
32B的Qwen2.5各項指標都遠遠超越GPT4-O mini
而14B的模型就跟GPT4-O mini伯仲之間打的有來有回
實際的測試應用上7B以上的模型在國中小服務學生應該是夠用
也可以相當程度的理解角色化GPTs的系統指令(System Prompt)的設定
但是3B以下的模型體感上就覺得他有點笨

所以我的建議是最少用7B的模型,條件稍好用14B的模型
電腦如果實在非常地陽春連顯卡都沒有那就只能用3B的模型體驗體驗

(上面的模型列表大部份是用Q4位元素壓縮量化的,數字越少速度越快但是模型越苯,數字越大模型速度越慢但是越聰明,可以的話儘量Q6~Q8,lm-studio裡面可以選,ollama不行)

注意如果你玩本地AI的話,不管是本地生圖還是大語言模型,甚至是AI動畫製作
老黃的顯卡是資源比較豐富的,如果你使用的是Mac或者是Intel的arc或是AMD的獨顯
都會比較容易遇到相容性和支援的問題
老手可以慢慢處理新手就不建議

又有人問我顯卡那麼貴
我會跟你說公家單位買看得見的設備比較容易買看不見的帳號比較折騰

2024年11月9日 星期六

使用lm-studio本地架設可以提供服務的網路伺服器來提供GPT服務

 

原來使用lm-studio就可以在區網提供GPT服務了
只要啟動lm-studio的server
客戶端使用chatbox將模型設定成兼容openai
給網址,不用給API KEY 就行了
真是太屌了,架區域LLM伺服器原來很簡單
不過應該還有你家自己防火牆的問題

2024年11月4日 星期一

建置本地LLM設備參考(以TOPS排序)

公司 型號 TOPS (FP8) VRAM 台幣參考售價 備註
NVIDIA RTX 4090 1,321 24GB GDDR6X 65,000 最強消費級顯卡
NVIDIA RTX 4080 Super 1,000 16GB GDDR6X 39,900
NVIDIA RTX 4080 780 16GB GDDR6X 38,900
NVIDIA RTX 4070Ti Super 670 16GB GDDR6X 32,900
AMD RX 7900 XTX 650 24GB GDDR6 39,900 AMD旗艦卡
NVIDIA RTX 4070Ti 580 12GB GDDR6X 29,900
AMD RX 7900 XT 520 20GB GDDR6 35,900
NVIDIA RTX 4070 Super 480 12GB GDDR6X 24,900
Intel Arc A770 450 16GB GDDR6 11,900 Intel首發旗艦卡
NVIDIA RTX 4070 420 12GB GDDR6X 22,900
AMD RX 7800 XT 400 16GB GDDR6 23,900
AMD RX 7700 XT 380 12GB GDDR6 19,900
Intel Arc A750 340 8GB GDDR6 9,900
NVIDIA RTX 4060Ti 310 8GB/16GB GDDR6 15,900/17,900
NVIDIA RTX 4060 280 8GB GDDR6 12,900
AMD RX 7600 250 8GB GDDR6 10,900
Intel Arc A580 240 8GB GDDR6 7,900
NVIDIA RTX 3060Ti 220 8GB GDDR6 11,900 上代中階卡
NVIDIA RTX 3060 180 12GB GDDR6 9,900
Intel Arc A380 150 6GB GDDR6 4,900
NVIDIA RTX 3050 140 8GB GDDR6 8,900
AMD RX 6500 XT 130 4GB GDDR6 5,900
Intel Core Ultra 7 285H 80 共享系統記憶體 - Intel最強筆電APU
Intel Core Ultra 7 165H 75 共享系統記憶體 -
Intel Core Ultra 5 125H 70 共享系統記憶體 -
AMD Ryzen 8845HS 65 共享系統記憶體 - AMD最新筆電APU
AMD Ryzen 7840HS 60 共享系統記憶體 -
AMD Ryzen 7835HS 55 共享系統記憶體 -
Apple M3 Ultra 50 共享系統記憶體 - Apple最強晶片
Apple M3 Pro 40 共享系統記憶體 -
Apple M3 35 共享系統記憶體 -
Apple M2 30 共享系統記憶體 -
Apple M1 25 共享系統記憶體 -
學習建議4060Ti/16G最具CP值,生產力請直上4090