本地AI部屬新手村: 用 NVIDIA 8GB 顯卡安裝 Ollama + OpenHands 本機 AI 程式開發環境

如果你想在自己的 Windows 電腦上建立一套「不需要付 API 費用」的 AI 程式開發環境,可以使用:

Ollama + 本機大型語言模型 + OpenHands

OpenHands 是一套 AI Coding Agent,它不只可以回答程式問題,還可以實際:

  • 建立檔案
  • 修改程式
  • 執行 Terminal 指令
  • 建立網站
  • 修改 WordPress Plugin
  • 分析專案
  • Debug
  • 執行 Python / Node.js
  • 使用 Git
  • 接 MCP Server
  • 自動完成多步驟開發工作

這篇教學使用的架構是:

Windows 11
│
├── NVIDIA GPU 8GB VRAM
│
├── Ollama for Windows
│     │
│     └── Qwen2.5-Coder 7B
│
└── WSL2 Ubuntu
      │
      └── OpenHands
            │
            ├── Terminal
            ├── 檔案編輯
            ├── Git
            └── Windows 專案資料夾

本教學完全不使用 Docker。


一、需要什麼硬體?

這篇文章主要針對以下電腦:

作業系統:Windows 11
顯示卡:NVIDIA
VRAM:8GB
記憶體:建議 16GB~32GB
硬碟:建議預留 20GB 以上

例如:

RTX 3060 8GB
RTX 4060 8GB
RTX 4060 Ti 8GB
RTX 3070 8GB
RTX 2070 8GB

都可以使用。

如果有 32GB RAM,使用體驗會更好。


二、8GB 顯卡不要直接裝 30B 模型

OpenHands 官方目前在本機模型文件中,推薦過 Qwen3-Coder 30B 等較大型 coding model,但 qwen3-coder:30b 在 Ollama 中模型大小約 19GB,並不適合只有 8GB VRAM 的電腦。

所以這篇教學選:

Qwen2.5-Coder 7B

Ollama 官方目前的 Qwen2.5-Coder 7B 大約是:

4.7 GB

而且具有:

32K Context

非常適合作為 NVIDIA 8GB 顯卡的入門模型。

我們會使用:

qwen2.5-coder:7b

三、安裝 NVIDIA Driver

首先確認 NVIDIA 顯示卡驅動已經安裝。

按:

Win + R

輸入:

powershell

然後輸入:

nvidia-smi

如果出現類似:

NVIDIA GeForce RTX 4060
Driver Version
CUDA Version
Memory-Usage

表示 NVIDIA Driver 正常。

例如:

+--------------------------------------------------------------------------------+
| NVIDIA-SMI                                                                    |
| GPU Name                       Memory-Usage                                    |
| NVIDIA GeForce RTX 4060        500MiB / 8192MiB                               |
+--------------------------------------------------------------------------------+

其中:

8192 MiB

代表大約 8GB VRAM。

如果:

nvidia-smi

顯示找不到指令,就先到 NVIDIA 官方網站安裝最新驅動。


四、安裝 Ollama

Ollama 可以直接在 Windows 執行,不需要放進 Docker,也不需要安裝在 WSL。

官方 Windows 版本目前支援 Windows 10 或更新版本。

打開 PowerShell。

執行:

irm https://ollama.com/install.ps1 | iex

等待安裝完成。

然後關閉 PowerShell,再重新開啟。

檢查:

ollama --version

接著:

ollama list

如果沒有錯誤,代表 Ollama 已經成功安裝。


五、下載 8GB 顯卡適用的 Coding Model

執行:

ollama pull qwen2.5-coder:7b

第一次需要下載約數 GB。

完成之後查看:

ollama list

應該會看到:

qwen2.5-coder:7b

六、第一次測試本機 AI

輸入:

ollama run qwen2.5-coder:7b

然後問:

請使用 Python 寫一個 Hello World

如果模型正常回答:

print("Hello World")

代表:

Windows
   ↓
NVIDIA GPU
   ↓
Ollama
   ↓
Qwen2.5-Coder

已經正常運作。

退出 Ollama:

/bye

七、確認 Ollama API

Ollama 不只是聊天程式,它同時提供本機 API。

預設位址:

http://localhost:11434

PowerShell 執行:

Invoke-RestMethod http://localhost:11434/api/tags

如果看到:

qwen2.5-coder:7b

代表 Ollama API 正常。

OpenHands 稍後就是透過這個 API 呼叫模型。


八、為什麼 OpenHands 不直接裝 Windows?

目前 OpenHands CLI 主要是 Linux/macOS 路線;Windows 使用者比較適合透過 WSL2 使用。

而且我們不想使用 Docker。

因此採用:

Windows
     │
     ├── Ollama
     │
     └── WSL2
            └── OpenHands

OpenHands 官方目前也提供 Process Sandbox,可以直接以一般本機程序執行,不必使用 Docker。

不過要注意:

Process Sandbox 沒有 Docker 隔離。

也就是說 OpenHands 可以執行目前帳號有權限執行的指令與修改檔案,所以不要隨便把未知、危險的指令交給 AI 執行。


九、安裝 WSL2

開啟「系統管理員 PowerShell」。

輸入:

wsl --install -d Ubuntu

安裝完成後:

重新啟動 Windows

重新開機後執行:

wsl

第一次 Ubuntu 會要求:

Enter new UNIX username

例如輸入:

admin

接著輸入密碼。

注意:

Linux 輸入密碼時螢幕不會顯示 *****

這是正常的。


十、確認 WSL2

回到 PowerShell:

wsl -l -v

應該看到:

NAME      STATE       VERSION
Ubuntu    Running     2

最重要的是:

VERSION 2

十一、讓 WSL 可以直接連 Windows Ollama

這一步非常重要。

Windows 11 新版 WSL2 可以使用 Mirrored Networking,讓 Windows 與 WSL 之間的 localhost 存取更方便。

在 PowerShell:

notepad $env:USERPROFILE\.wslconfig

加入:

[wsl2]
networkingMode=mirrored

儲存。

然後執行:

wsl --shutdown

重新進入:

wsl

十二、從 WSL 測試 Ollama

現在是在 Ubuntu / WSL 裡。

輸入:

curl http://127.0.0.1:11434/api/tags

如果出現:

qwen2.5-coder:7b

表示:

WSL
 ↓
Windows localhost
 ↓
Ollama

已經連線成功。

如果這一步成功,後面會簡單很多。


十三、設定 Ollama Context Length

這一點對 OpenHands 非常重要。

OpenHands 官方特別提醒,本機 Ollama 的 context 太小會造成:

  • Agent 行為異常
  • system prompt 放不下
  • 工具呼叫失敗
  • AI 看起來像普通聊天機器人
  • 無法正確編輯專案

官方文件指出至少需要約:

22000

並使用:

32768

作為 Ollama 範例。

因此我們設定:

32768

在 Windows PowerShell 執行:

setx OLLAMA_CONTEXT_LENGTH 32768

再設定模型常駐:

setx OLLAMA_KEEP_ALIVE -1

完成後:

完全關閉 Ollama,再重新啟動 Ollama。

如果右下角系統列有 Ollama 圖示:

右鍵
→ Quit Ollama

然後從 Windows 開始選單重新開啟 Ollama。


十四、8GB VRAM 使用 32K Context 要注意

雖然:

Qwen2.5-Coder 7B

模型本體大約 4.7GB,但 Context Cache 也會使用記憶體。

所以:

8GB VRAM
+
32K Context

可能無法完全放進 GPU。

這並不代表不能使用。

Ollama 可以將部分內容放到:

System RAM

因此建議:

8GB VRAM
16GB RAM = 可以使用
32GB RAM = 比較舒服

如果速度非常慢,可以稍微降低 Context,例如:

setx OLLAMA_CONTEXT_LENGTH 24576

但不建議降到:

4096
8192

因為對 OpenHands 來說通常太小。


十五、安裝 OpenHands 所需要的 Linux 套件

進入 WSL:

wsl

更新 Ubuntu:

sudo apt update

再升級:

sudo apt upgrade -y

安裝基礎工具:

sudo apt install -y curl git build-essential

十六、安裝 uv

目前安裝 OpenHands CLI 很方便的方法是使用 uv

執行:

curl -LsSf https://astral.sh/uv/install.sh | sh

安裝完成後:

source ~/.bashrc

確認:

uv --version

十七、安裝 OpenHands

使用 Python 3.12 安裝 OpenHands:

uv tool install openhands --python 3.12

如果安裝完成後還找不到 openhands

source ~/.bashrc

然後:

openhands --version

如果有顯示 OpenHands 版本:

OpenHands ...

代表成功。


十八、建立 Windows 工作目錄

例如我們希望所有 AI 專案放在:

C:\Users\你的帳號\workspace

PowerShell:

mkdir $HOME\workspace

例如 Windows 帳號是:

u8

Windows 路徑就是:

C:\Users\u8\workspace

但是 WSL 看 Windows C 槽的方式是:

/mnt/c/

所以:

C:\Users\u8\workspace

在 WSL 就是:

/mnt/c/Users/u8/workspace

十九、建立第一個 OpenHands 專案

例如:

mkdir -p /mnt/c/Users/u8/workspace/my-first-project

進入:

cd /mnt/c/Users/u8/workspace/my-first-project

查看:

pwd

應該顯示:

/mnt/c/Users/u8/workspace/my-first-project

二十、設定 OpenHands 使用 Ollama

因為我們使用 Ollama 的 OpenAI-Compatible API,所以設定:

export LLM_MODEL="openai/qwen2.5-coder:7b"

API:

export LLM_BASE_URL="http://127.0.0.1:11434/v1"

API Key:

export LLM_API_KEY="local-llm"

這個:

local-llm

不是真正的 API Key。

Ollama 本機不需要 API Key,只是部分 OpenAI-compatible client 需要有一個非空白值。

OpenHands 官方文件也是使用 dummy / local-llm 這類 placeholder。


二十一、設定 OpenHands 不使用 Docker

輸入:

export RUNTIME=process

這代表:

OpenHands Sandbox
=
Process

而不是:

Docker

OpenHands 官方目前支援:

RUNTIME=docker
RUNTIME=process
RUNTIME=remote

其中:

process

就是直接在目前電腦執行。


二十二、啟動 OpenHands

現在輸入:

openhands --override-with-envs

--override-with-envs 會讓 OpenHands 使用剛剛設定的:

LLM_MODEL
LLM_BASE_URL
LLM_API_KEY

OpenHands 官方 CLI 目前也支援透過這些環境變數覆寫模型設定。

第一次啟動可能需要一些時間。


二十三、第一次給 OpenHands 任務

例如輸入:

請在目前資料夾建立一個簡單網站。

要求:
1. 建立 index.html
2. 建立 style.css
3. 建立 app.js
4. 網頁標題為 My First OpenHands Project
5. 做一個簡單的響應式首頁
6. 完成後檢查所有檔案

OpenHands 就不只是「告訴你程式碼」。

它會開始:

分析需求
↓
查看資料夾
↓
建立 index.html
↓
建立 style.css
↓
建立 app.js
↓
檢查檔案
↓
修正問題

回到 Windows:

C:\Users\u8\workspace\my-first-project

你就可以直接看到 OpenHands 建立的檔案。


二十四、每次都輸入 export 很麻煩怎麼辦?

現在每次開 WSL 都需要:

export LLM_MODEL="openai/qwen2.5-coder:7b"
export LLM_BASE_URL="http://127.0.0.1:11434/v1"
export LLM_API_KEY="local-llm"
export RUNTIME=process

我們可以把它永久寫入:

nano ~/.bashrc

移到最下面。

加入:

# OpenHands + Ollama
export LLM_MODEL="openai/qwen2.5-coder:7b"
export LLM_BASE_URL="http://127.0.0.1:11434/v1"
export LLM_API_KEY="local-llm"
export RUNTIME=process

按:

Ctrl + O

Enter。

再按:

Ctrl + X

載入設定:

source ~/.bashrc

測試:

echo $LLM_MODEL

應該看到:

openai/qwen2.5-coder:7b

二十五、以後如何啟動?

以後其實非常簡單。

第一步:Windows 啟動 Ollama

通常 Ollama 會跟 Windows 一起啟動。

測試:

ollama list

第二步:開啟 WSL

PowerShell:

wsl

第三步:進入專案

例如:

cd /mnt/c/Users/u8/workspace/my-first-project

第四步:啟動 OpenHands

openhands

如果需要強制使用環境變數:

openhands --override-with-envs

完成。


二十六、檢查 OpenHands 是否真的使用 NVIDIA GPU

OpenHands 執行工作的同時,再開一個 Windows PowerShell:

nvidia-smi

如果看到 Ollama 使用 GPU,例如:

ollama.exe

以及顯存:

5000MiB
6000MiB
7000MiB

表示本機模型正在使用 NVIDIA GPU。

也可以執行:

ollama ps

查看目前執行中的模型。


二十七、推薦的 NVIDIA 8GB 模型

對 8GB VRAM,我建議從:

qwen2.5-coder:7b

開始。

下載:

ollama pull qwen2.5-coder:7b

優點:

模型:約 4.7GB
Context:32K
用途:Coding
VRAM:8GB 可以實際使用

Ollama 官方 Qwen2.5-Coder 系列另外還有:

0.5B
1.5B
3B
7B
14B
32B

其中官方頁面顯示:

7B:約 4.7GB
14B:約 9GB
32B:約 20GB

所以對 8GB VRAM 而言,7B 是比較合理的選擇。


二十八、為什麼不推薦 14B?

你可能會想:

ollama pull qwen2.5-coder:14b

它也可以執行。

但模型約:

9GB

已經超過:

8GB VRAM

所以勢必會有部分模型放進 RAM。

結果通常是:

可以跑
但是比較慢

而且 OpenHands 本身不是只問一次 AI。

Coding Agent 可能會:

思考
→ 呼叫工具
→ 查看結果
→ 再思考
→ 修改
→ 再測試
→ 再修正

因此速度差距會被放大。

新手先用:

7B

比較合理。


二十九、不要使用 qwen3-coder:30b 在 8GB 顯卡

例如:

ollama pull qwen3-coder:30b

這個模型約:

19GB

Ollama 官方目前也將它列為 30B coding model。

8GB VRAM 雖然可以依賴 RAM 做部分 offload,但對 OpenHands 這種 Agent 工作來說通常太慢。

因此:

RTX 8GB
→ Qwen2.5-Coder 7B

比較適合入門。


三十、常見錯誤:Ollama is not reachable

如果 OpenHands 顯示:

Ollama is not reachable

先從 Windows 測試:

Invoke-RestMethod http://localhost:11434/api/tags

成功後,再從 WSL:

curl http://127.0.0.1:11434/api/tags

兩個都應該看到:

qwen2.5-coder:7b

如果 Windows 成功、WSL 失敗,問題通常就是:

WSL Networking

重新確認:

notepad $env:USERPROFILE\.wslconfig

內容:

[wsl2]
networkingMode=mirrored

然後:

wsl --shutdown

重新:

wsl

再測一次。


三十一、常見錯誤:OpenHands 只聊天、不寫檔案

如果 OpenHands:

一直回答文字
但不執行工具
不建立檔案
不使用 Terminal

不一定是 OpenHands 壞掉。

可能是:

模型工具呼叫能力不足

或者:

Context 太小

OpenHands 官方也特別提到,本機模型可能出現普通聊天機器人式的行為、工具呼叫失敗或 malformed JSON。

先確認:

setx OLLAMA_CONTEXT_LENGTH 32768

並重新啟動 Ollama。


三十二、常見錯誤:模型非常慢

執行:

ollama ps

再執行:

nvidia-smi

檢查是不是 GPU 正在使用。

如果 VRAM 已經完全滿:

8100 / 8192 MiB

可以關掉其他 GPU 程式,例如:

ComfyUI
Stable Diffusion
大型遊戲
其他 AI 模型

特別是 ComfyUI 和 Ollama 同時使用時,8GB VRAM 很容易不足。


三十三、OpenHands 可以直接修改 Windows 檔案嗎?

可以。

例如:

Windows:

C:\Users\u8\workspace\wordpress-plugin

WSL:

/mnt/c/Users/u8/workspace/wordpress-plugin

執行:

cd /mnt/c/Users/u8/workspace/wordpress-plugin

再:

openhands

然後告訴它:

分析目前 WordPress Plugin。

找出 PHP Error。
不要破壞現有功能。
修改之前先閱讀所有相關檔案。
完成後執行 PHP syntax check。

OpenHands 就能直接修改 Windows 裡的專案。


三十四、建議不要讓 AI 直接碰重要正式站資料

因為我們使用:

RUNTIME=process

沒有 Docker 隔離。

所以建議專案放:

C:\Users\你的帳號\workspace

例如:

workspace
├── wordpress-test
├── plugin-dev
├── website-test
├── comfyui-tools
└── python-test

不要一開始就把:

正式網站
公司資料
密碼
SSH Private Key

整個交給 Agent。


三十五、完整架構

完成後,你的電腦會變成:

┌───────────────────────────────┐
│          Windows 11           │
│                               │
│ NVIDIA RTX 8GB                │
│       │                       │
│       ▼                       │
│    Ollama                     │
│       │                       │
│ Qwen2.5-Coder 7B              │
│       │                       │
│ localhost:11434               │
│       ▲                       │
│       │                       │
│ ┌─────┴─────────────────────┐ │
│ │          WSL2             │ │
│ │                           │ │
│ │       OpenHands           │ │
│ │           │               │ │
│ │     Process Sandbox       │ │
│ │           │               │ │
│ │ /mnt/c/Users/.../workspace│ │
│ └───────────────────────────┘ │
│                               │
└───────────────────────────────┘

完全不需要:

Docker Desktop
Docker Container
OpenAI API
Claude API

AI 推論由自己的 NVIDIA GPU 執行。


三十六、新手快速安裝指令總整理

Windows PowerShell

安裝 Ollama:

irm https://ollama.com/install.ps1 | iex

下載模型:

ollama pull qwen2.5-coder:7b

設定 Context:

setx OLLAMA_CONTEXT_LENGTH 32768

設定常駐:

setx OLLAMA_KEEP_ALIVE -1

安裝 WSL:

wsl --install -d Ubuntu

WSL Ubuntu

更新系統:

sudo apt update && sudo apt upgrade -y

安裝工具:

sudo apt install -y curl git build-essential

安裝 uv:

curl -LsSf https://astral.sh/uv/install.sh | sh

重新載入:

source ~/.bashrc

安裝 OpenHands:

uv tool install openhands --python 3.12

設定模型:

export LLM_MODEL="openai/qwen2.5-coder:7b"
export LLM_BASE_URL="http://127.0.0.1:11434/v1"
export LLM_API_KEY="local-llm"
export RUNTIME=process

測試 Ollama:

curl http://127.0.0.1:11434/api/tags

進入專案:

cd /mnt/c/Users/你的Windows帳號/workspace

啟動 OpenHands:

openhands --override-with-envs

完成。


結語

如果你只有一張 NVIDIA 8GB 顯卡,其實已經可以建立一套真正能工作的本機 AI Coding Agent。

我比較建議的入門組合是:

Windows 11
+
NVIDIA 8GB
+
Ollama
+
Qwen2.5-Coder 7B
+
WSL2
+
OpenHands
+
Process Sandbox

最大的優點就是:

不用租 GPU
不用 OpenAI API
不用 Claude API
不用 Docker
模型在自己的電腦執行
可以直接修改自己的 Windows 專案

但也要理解一件事:

7B 本機模型的能力,不會等同目前最強的雲端大型模型。

尤其 OpenHands 是 Agent 型工具,除了寫程式之外還高度依賴工具呼叫、長上下文與多步推理。因此 8GB VRAM 的配置比較適合學習、一般網站、WordPress、PHP、HTML、JavaScript、Python、小型專案與 AI Agent 實驗。

等未來升級到:

16GB VRAM
24GB VRAM
32GB VRAM

再考慮更大的 Coding Model,OpenHands 的自主開發能力也會明顯提高。

而完成這套環境之後,下一步還可以繼續加入:

OpenHands
     │
     ├── Ollama Local AI
     ├── Git / GitHub
     ├── WordPress 專案
     ├── Browser
     └── MCP
           │
           └── ComfyUI MCP
                 │
                 └── ComfyUI

讓 OpenHands 不只會寫程式,甚至可以進一步控制 ComfyUI、建立工作流,以及組成完整的本機 AI 自動化工作站。