【專家說】本機 AI 實測|64GB MacBook 一直「高不成低不就」?Qwen3.8 27B 終於填到個窿,仲可以用 iPhone 隔空叫佢做嘢

| ezone.hk 編輯部 | 24-08-2026 17:14 |
在Google
追蹤《e-zone》
【專家說】本機 AI 實測|64GB MacBook 一直「高不成低不就」?Qwen3.8 27B 終於填到個窿,仲可以用 iPhone 隔空叫佢做嘢

買咗部 64GB 嘅 MacBook M5 Pro,想喺本機行個似樣嘅大型語言模型,但揀嚟揀去都唔啱:勁嘅要 80GB 以上先行得順,行得郁嘅又係為 16GB 機而設,64GB 白白閒置。今次 Qwen3.8 27B 一出,終於等到一個真正食盡 64GB 嘅選擇。

本文用三個步驟教你由零裝起,最後仲可以喺 iPhone 直接用返部 Mac 上面嘅模型。

64GB 嘅尷尬:唔上唔落

我幾個月前入手咗呢部 MacBook Pro 16 吋、M5 Pro、64GB 統一記憶體。買嗰陣諗住 64GB 應該乜都行到,點知真係揀模型嗰陣先發現問題。

本文全部實測都係喺呢部機做:

  • MacBook Pro 16 吋
  • Apple M5 Pro
  • 64GB 統一記憶體
  • macOS Tahoe 26.5.2

市面上嘅模型基本上分兩派。一派係「大到你行唔起」——動輒要 80GB、甚至過百 GB 記憶體,64GB 直頭載入唔到。另一派係「細到嘥咗你部機」——佢哋設計嗰陣就係要塞入 16GB、24GB 嘅機,你用 64GB 行佢,多出嗰 40 幾 GB 完全冇用武之地。

換句話講,一直都冇一個模型係專登為 64GB 呢個級數而設。直到 2026 年 8 月 14 日,阿里巴巴通義實驗室開源咗 Qwen3.8 27B,情況先至有變。

點解 27B 啱 64GB?關鍵係「唔使將就 4-bit」

好多人以為 27B 一定要 64GB 先行到——其實唔係,4-bit 量化得 16GB 左右,24GB 嘅 Mac 都行到。但嗰個係「行到」,唔係「行得好」。

64GB 真正嘅價值,係你可以直接上 8-bit(約 29.5GB),保住模型嘅完整精度,同時仲有大把空間去撐開長 context,後台其他 App 照開唔會卡。呢樣就係 24GB 機做唔到嘅嘢。

STEP 1|安裝 LM Studio、下載 Qwen3.8 27B

首先去 lmstudio.ai 下載 LM Studio(Mac 版免費),拉入「應用程式」開啟就得。

裝好之後撳左邊嘅搜尋圖示,喺搜尋欄打「qwen」。

Qwen3.8 27B 排喺搜尋結果第一位,仲掛住「Staff Pick」標籤,下載量已經超過 87 萬次。

右邊可以見到三個能力標籤:

  • Vision(睇圖)
  • Tool Use(用工具)
  • Reasoning(推理)

呢三樣後面兩個步驟都會用到。

揀邊個版本?呢一步最重要

撳右邊嘅下載選項,會彈出成串版本畀你揀。好多人喺呢度求其撳一個就下載,但揀錯咗就等於嘥咗你部 64GB 機。

版本 格式 容量 建議
4BIT MLX 16.08GB 24GB 機先要就住用
5BIT MLX 19.44GB 想快啲可以揀
6BIT MLX 22.80GB 速度/質素平衡
8BIT MLX 29.53GB 64GB 機首選,推薦
Q4_K_M/Q6_K/Q8_0 GGUF 17.7 至 30GB 非 Apple 機先用

兩個揀版本嘅原則

① Apple Silicon 一定揀 MLX,唔好揀 GGUF。

MLX 係 Apple 自己出嘅框架,直接食 M 系晶片嘅統一記憶體架構,快好多。

② 64GB 機請揀 8BIT。

29.53GB 對 24GB 機嚟講係載入唔到,但對你部 64GB 機嚟講只係用咗一半,呢個就係你部機唯一嘅優勢,唔好浪費。

載入模型,睇實記憶體用量

下載完成後(約 30GB,睇你網速,可能要等一陣),撳最頂嘅模型選單,揀返 Qwen3.8 27B 載入。

載入成功。留意右上角:

Memory Consumption 28.52GB / 64GB

用咗少過一半,仲有 35GB 畀其他 App。Context 設到 131,072 tokens,等於一次過餵成本書都得。

亦都留意返下載頁面嗰個綠色標籤:

Full GPU Offload Possible

即係成個模型可以完全放入 GPU 行,唔使分一半去 CPU——呢個係速度嘅關鍵。

試傾第一句:

hello what is your model?

佢答得好爽快,仲會顯示思考時間同每秒 token 數。到呢一步,你部 Mac 已經係一部完全離線嘅 AI 電腦,冇網路都用得。

老實講一句:8-bit 唔係最快嗰個。

8-bit 換嚟嘅係質素,唔係速度。如果你主要係要快,例如即時對答、寫短訊息,5BIT 或者 6BIT 會順手好多。

我自己嘅用法係兩個都裝:

  • 要質素同長文件分析就用 8BIT
  • 要快就切去 6BIT

反正你有 64GB,唔差呢啲空間。

STEP 2|裝 web-search 外掛,叫佢搵今日新聞

本機模型有個先天限制:佢嘅知識停留喺訓練嗰一日,你問佢今日發生咩事,佢一定答唔到。

解決方法就係畀佢一對「眼」去上網——呢個就係 web-search 外掛嘅作用。

喺 LM Studio 入面去:

Settings → Integrations

altra/web-search 撳下載。成個外掛得 44.78KB,秒速裝好。

最重要係嗰句:

No API key required

唔使申請任何 API key,唔使畀錢,裝完即用。

裝好之後返去對話視窗,撳輸入框下面嘅鎚仔圖示(Integrations),將 altra/web-search 撥去「開」。撥開之後,輸入框下面會多咗個藍色「web-search」標籤,代表已經生效。

旁邊仲有以下選項可以一齊開:

  • Think(思考模式)
  • Reasoning Effort(推理強度)
  • Vision(睇圖)

實測:問佢今日香港有咩新聞

我直接問佢:

今日香港有咩新聞?

然後就見到最有趣嘅一幕——佢冇即刻答,而係開始自己一步一步搵資料。模型自己輪流叫咗:

  • search
  • search_news
  • fetch_and_read
  • search_recent

幾個工具,每次攞完結果都會再「Thought for 13 秒 / 17 秒 / 21 秒」諗一諗,然後決定下一步去邊度搵。呢個就係所謂 Agentic(自主代理)行為。

整個過程佢諗咗 3 分 46 秒,讀咗幾個新聞網站,最後交出一份分好類嘅摘要。

結果分咗「財經/股市」、「政務/兩地」、「社會」幾大類,每條都有具體數字。而且係用廣東話書面語寫,唔使特別叫佢轉。

最值得欣賞嘅一句,佢開頭自己補咗一句:

部分項目只有一個來源、未及交叉核實,詳請建議睇原文。

肯講自己邊部分未核實過,比起亂噏一通有紋有路得多。呢個係 altra/web-search 內置嘅 source verification 機制——佢會主動標示單一來源嘅資訊為「未經核實」。

要留意嘅係,本機模型做呢類搜尋任務係慢嘅。3 分幾鐘先出到一份摘要,比起雲端服務慢好多。但換返嚟嘅係:你唔使畀月費、唔使開帳戶,而且除咗搜尋嗰下之外,你嘅問題同對話內容全部留喺部機度。

STEP 3|開啟 LM Link,用 iPhone 隔空叫部 Mac 做嘢

到呢一步,模型行得好好,但有個問題:你一離開部 Mac 就用唔到。

LM Link 就係解決呢件事——佢可以令你部 iPhone 用返部 Mac 上面嘅模型,效果就好似模型行喺電話入面咁。

3a. 喺 Mac 開啟 LM Link

去:

Settings → LM Link

將以下兩個選項撥去 ON:

  • Enable LM Link
  • Allow loading models on this machine

兩個掣都要開。Allow loading models on this machine 如果唔開,其他裝置搵唔到你部機嘅模型。

下面嘅 Device name 預設叫「Mac」,可以改成自己認得嘅名。

LM Link 需要一個 LM Studio 帳戶,免費。登入之後喺網頁後台可以睇到連線狀態。顯示:

Status: Enabled

部 Mac 狀態 Online。免費帳戶最多可以連 5 部裝置。

留意佢寫明係:

End-to-end encrypted

即端對端加密。

3b. iPhone 裝 App 並配對

去 App Store 搵:

Locally AI by LM Studio

要認住係 LM Studio 官方出嗰個,唔好裝錯其他同名 App。

配對成功之後,iPhone 就會見到部 Mac,同埋部 Mac 上面載入緊嘅模型。

狀態「已連線」,「遠端裝置上的模型」清楚顯示住 Qwen3.8 27B。

3c. 揀模型,開始用

撳頂部嘅模型選單,見到 Qwen 3.8 (27B),下面細字標住「Mac」,即係話呢個模型實際係行喺部 Mac 度。

下面寫住:

LM Link 線上 · 1 部裝置已連線

最後試埋佢嘅睇圖能力。我喺 iPhone 相簿揀咗一張維港相,直接問:

這是什麼地方?

佢認得出係香港中環天際線,仲講埋拍攝角度係由尖沙咀/九龍側望向港島,然後逐幢認出國際金融中心二期同中銀大廈,連中銀大廈嗰個鋸齒狀外形都描述到。

留意:呢啲運算全部喺部 Mac 度做。

你部 iPhone 冇裝過任何 27B 模型,電話都根本裝唔落。張相傳去咗部 Mac、由 Qwen3.8 27B 處理、答案再傳返電話。

相片同對話內容由頭到尾冇離開過你自己嘅兩部機,冇經第三方伺服器。

總結:64GB 唔再係浪費

行完呢三步,你部 64GB MacBook 就變成一部完整嘅私人 AI 伺服器:

  • 離線可用:冇網路都照答,唔使月費,唔使 API key。
  • 可以上網搵料:裝個外掛就有即時資訊,仲會自己標示邊啲未核實。
  • 睇得明圖:影相直接問,唔使另外裝模型。
  • 手機隨時用:出街用 iPhone 照叫得郁部 Mac。
  • 私隱留喺自己度:資料唔會過第三方。

我覺得最值得講嘅一點係:唔好求其撳個 4-bit 就算。好多教學文都係叫人揀最細嗰個版本,因為佢哋要照顧 16GB、24GB 嘅讀者。

但如果你部機有 64GB,你係有條件揀 8-bit 嘅——而呢個選擇,正正就係你當初多畀嗰筆錢買返嚟嘅嘢。

等咗幾個月,總算搵到一個真正配得起呢部機嘅模型。

(作者為 Bullseye Education 創辦人 Eric Wong,長期研究 AI 工具喺教學同創作上嘅實際應用,並於中小學及教師培訓場合分享 AI 應用心得。)

本文所有截圖均為實機操作紀錄,測試機為 MacBook Pro 16 吋(M5 Pro/64GB/macOS Tahoe 26.5.2)。

Qwen3.8 27B 是專為 64GB 記憶體設計的模型,能充分利用其容量,運行 8-bit 版本約需 29.53GB,保留大量空間供其他應用程式使用。

透過 LM Studio 安裝 altra/web-search 外掛,無需 API key 即可啟用。啟用後,模型便能自行搜尋網上資料,並提供經交叉核實的摘要。
Page 1 of 9