OSVauco/protocols/sessions/2026-05-24_opax-heavy-mode-llm-ruting-rag.md

45 lines
2.5 KiB
Markdown

date: 2026-05-24T16:00:00+02:00
thread_topic: OPAX heavy mode + LLM-rutingsstrategi + RAG re-indeksering
trigger: session-close
context_snapshot: >
Verifiserte at osvauco-agent svarer korrekt via /run-endepunktet med RAG-henting fra MASTERPLAN.
Designet og implementerte OPAX heavy mode (mode: heavy) som gir OPAX tilgang til tyngre modeller
(gemini-2.5-pro, gemini-3.5-flash) og multi-agent pipeline ved behov per prosjekt.
Oppdaterte MASTERPLAN.md og masterplan-summary.md med ny LLM-rutingsstrategi inkl. heavy mode.
Forsoekte RAG re-indeksering men stotet paa Spanner-kapasitetsbegrensning og SDK-versjonsproblem.
completed_tasks:
- Verifisert /run-endepunkt med curl-test mot osvauco-agent (session test-002)
- Designet OPAX heavy mode: mode-parameter, modellfordeling, budsjettgrenser, whitelist
- Oppdatert MASTERPLAN.md: ny LLM-RUTINGSSTRATEGI-seksjon med OPAX Heavy Mode (linje 309-384)
- Oppdatert masterplan-summary.md: LLM-rutingsstrategi-tittel + OPAX heavy mode-notat
- Fikset setup_corpus.py: byttet fra Spanner/RagVectorDbConfig til Serverless (ingen backend_config)
open_tasks:
- Kjoere setup_corpus.py paa nytt etter backend_config-fjerning og verifisere RAG-indeksering
- Verifisere at agent svarer korrekt paa 'OPAX heavy mode'-sporsmal etter re-indeksering
- Implementere mode-parameteret i agent.py / models.py (RunRequest + get_models_for_mode)
- Legge til HEAVY_MODE_ALLOWED_USERS-guard i agent.py
- Oppdatere .env med HEAVY_*-variabler
- Phase 4: Docs hardening (LEARNINGS.md, SECRETS-SETUP.md, IAP-SETUP.md)
- Phase 5: IAP paa opax.vauco.no
decisions:
- OPAX faar eksplisitt mode-parameter (standard/heavy) per request - ikke global toggle
- Heavy mode autorisert kun for user_id: opax, admin
- Budsjettgrense heavy mode: $10/dag (vs $3/dag standard), hard stopp $3 per oppgave
- RAG Engine: Serverless mode (ingen backend_config) erstatter Spanner - unngaar allowlist-krav
- Primaeregion forblir us-central1 for aa dekke alle modeller inkl. gemini-3.5-flash
- us-east1 droppes som region for RAG (Spanner-kapasitetsproblem)
skills_used:
- Python linje-for-linje filoppdatering via Cloud Shell
- Vertex AI RAG Engine API (RagVectorDbConfig, Serverless mode)
- Cloud Run /run endpoint curl-testing
- MASTERPLAN.md-arkitektur og dokumentasjon
next_action: >
Kjore python3 agents/rag/setup_corpus.py (etter backend_config-fjerning) og verifisere
at RAG returnerer korrekt svar paa 'Hva er OPAX heavy mode?'.
Deretter implementere mode-parameter i agent.py.