從 Windows CMD 遠端測試 Ollama:Qwen3 中文回覆成功紀錄
讓 GIGABYTE BRIX 負責本地模型推論,Windows 電腦負責操作與後續語音互動。本篇記錄 SSH 隧道、模型選擇、中文編碼排查,以及成功取得繁體中文回覆的完整過程。
測試環境
本次以 GIGABYTE GB-BTIP-N150(16GB)作為 Ollama 主機,安裝 Ubuntu;另一台 Windows 電腦透過 SSH 使用 Ollama API。麥克風、喇叭與未來的語音介面都規劃在 Windows 電腦端。
- Ollama 主機:
192.168.1.114 - 主機端 Ollama API:
127.0.0.1:11434 - Windows 本機轉送埠:
127.0.0.1:11435 - 成功模型:
qwen3:4b-instruct-2507-q4_K_M - Ollama API 版本:
0.35.1
一、以 SSH 建立 API 隧道
在 Windows CMD 開啟第一個視窗,輸入以下指令:
ssh -N -L 127.0.0.1:11435:127.0.0.1:11434 nfusrai@192.168.1.114
輸入 Ubuntu 帳號密碼後,視窗會停留在連線狀態、沒有新的命令提示符,這是正常的。測試時要保持此視窗開啟。
另開一個 Windows CMD,確認 API 隧道已連通:
curl.exe http://127.0.0.1:11435/api/version
收到下列類似回應,就代表 Windows 已經能透過 SSH 連到 Ollama:
{"version":"0.35.1"}
二、確認原模型的回覆模式
原先安裝的 qwen3:4b 可以載入與執行,但 API 測試時,生成上限用完前仍在輸出 thinking,正式回答欄位 response 是空白。回應中的 done_reason":"length" 表示生成額度用完,模型還沒有完成回答。
進一步查詢 /api/show 後,模型回報思考模式只有 true 這個可用值。也就是說,這個安裝版本不能透過 "think":false 關閉思考模式。對一般短問答而言,改用 Instruct 取向的模型更合適。
三、下載 Qwen3 4B Instruct 模型
在另一個 Windows CMD 視窗,以 SSH 登入 BRIX 並下載量化版模型:
ssh nfusrai@192.168.1.114 ollama pull qwen3:4b-instruct-2507-q4_K_M
等待下載完成。原有 Thinking 模型可以先保留;呼叫 API 時指定新的模型名稱即可。
四、排除 Windows CMD 中文編碼問題
最初使用 CMD 的 echo 將中文字寫入 JSON 檔,模型收到後表示內容像是亂碼。改用記事本直接輸入中文仍未排除問題。最後將中文改寫成 JSON Unicode escape,避開命令列與檔案傳送過程中的中文編碼差異。
在 Windows CMD 輸入以下命令開啟記事本:
notepad ollama_test.json
把下列 JSON 貼入記事本,按 Ctrl+S 儲存後關閉:
{"model":"qwen3:4b-instruct-2507-q4_K_M","prompt":"\u8acb\u7528\u7e41\u9ad4\u4e2d\u6587\u7c21\u77ed\u81ea\u6211\u4ecb\u7d39\u3002","stream":false,"options":{"num_predict":128}}
這串 \u 編碼會由 JSON 解碼成「請用繁體中文簡短自我介紹。」整份測試檔只有英數字元,因此不必直接在 CMD 中傳送中文字。
五、從 Windows 呼叫模型
確認 SSH 隧道視窗仍保持連線後,在另一個 CMD 視窗執行:
curl.exe --max-time 120 http://127.0.0.1:11435/api/generate -H "Content-Type: application/json" --data-binary "@ollama_test.json"
成功時,API 回傳的 model 欄位會是 qwen3:4b-instruct-2507-q4_K_M,而 response 欄位會出現繁體中文自我介紹。本次測試已成功取得中文回答,表示整段流程都已連通:
Windows CMD → SSH 隧道 → BRIX 上的 Ollama → Qwen3 Instruct 模型
測試結論與後續方向
這次測試釐清兩個關鍵點:第一,原本的 qwen3:4b 使用 Thinking 取向,思考輸出會占用生成額度;第二,Windows CMD 傳送中文時可能遇到編碼差異。改用 Qwen3 4B Instruct,並以 JSON Unicode escape 傳送中文後,模型已能正常以繁體中文回覆。
下一步可在 Windows 電腦端加入語音辨識與台語文字處理,再將辨識結果傳給 Ollama;收到回答後,由 Windows 端的台語語音合成播放。BRIX 專責本地模型推論,Windows 則負責麥克風、喇叭與互動介面。
沒有留言:
張貼留言