2.1 KiB
2.1 KiB
LLM Stack — gitea-cpu-vm
Sist oppdatert: 2026-07-22 04:19 CEST
VM: gitea-cpu-vm · e2-highmem-4 (4 vCPU / 32 GB RAM) · us-central1-b
Statisk IP: 34.170.51.84
Ollama: port 11434 · Gitea: port 3000
Aktiv modellstack
| Prioritet | Modell | Params | Disk | Capabilities | Rolle |
|---|---|---|---|---|---|
| 1 | gemma3:4b |
4.3B | 3.3 GB | completion | Frontmodell / rask default |
| 2 | qwen2.5:3b |
3.1B | 1.9 GB | completion, tools | Lett tool-/agentmodell |
| 3 | qwen2.5:7b |
7.6B | 4.7 GB | completion, tools | Standard mellomlag |
| 4 | qwen2.5-coder:7b |
7.6B | 4.7 GB | completion, tools, insert | Target coder |
| 5 | qwen2.5-coder:14b |
14.8B | 9.0 GB | completion, tools, insert | Backup coder (asynkron) |
Total diskbruk: ~23.6 GB
Operativ ruting
- Start med
gemma3:4b— raske svar, enkel resonnering - Eskaler til
qwen2.5:3bnår oppgaven trenger tools og fart er kritisk - Eskaler til
qwen2.5:7bnår kvalitet må opp, men latency fortsatt må være brukbar (~2.7 tok/s) - Bruk
qwen2.5-coder:7bsom standard for kode-/repo-arbeid - Bruk
qwen2.5-coder:14bkun for tunge batch-/asynkrone kodeoppgaver
Fjernede modeller (med begrunnelse)
| Modell | Fjernet | Begrunnelse |
|---|---|---|
qwen2.5:14b |
2026-07-22 | Testet til 1.4 tok/s varm — for treg som interaktiv standardmodell |
gemma3:12b |
2026-07-22 | Ingen tool-support, tregere enn qwen2.5:7b, dekket ingen unik rolle |
Ikke anbefalt på denne VM-en
gemma3:27b— CPU er flaskehalsen, ikke RAM- Alle modeller > 14B — upraktisk responstid for interaktiv bruk
Neste steg
- Test
qwen2.5-coder:7bpå ekte repo-/kodeoppgave - Sammenlign subjektivt med
qwen2.5-coder:14b - Mål RAM/swap under last (
free -h) - Vurder å fjerne
qwen2.5-coder:14bhvis 7B er god nok i praksis
Nyttige kommandoer
# Bekreft modelliste
curl http://localhost:11434/api/tags
# RAM / swap under last
free -h
# Modellplass på disk
du -sh /usr/share/ollama/.ollama/models