OSVauco/protocols/sessions/2026-05-24_opax-heavy-mode-llm-ruting-rag.md

2.5 KiB

date: 2026-05-24T16:00:00+02:00 thread_topic: OPAX heavy mode + LLM-rutingsstrategi + RAG re-indeksering trigger: session-close context_snapshot: > Verifiserte at osvauco-agent svarer korrekt via /run-endepunktet med RAG-henting fra MASTERPLAN. Designet og implementerte OPAX heavy mode (mode: heavy) som gir OPAX tilgang til tyngre modeller (gemini-2.5-pro, gemini-3.5-flash) og multi-agent pipeline ved behov per prosjekt. Oppdaterte MASTERPLAN.md og masterplan-summary.md med ny LLM-rutingsstrategi inkl. heavy mode. Forsoekte RAG re-indeksering men stotet paa Spanner-kapasitetsbegrensning og SDK-versjonsproblem.

completed_tasks:

  • Verifisert /run-endepunkt med curl-test mot osvauco-agent (session test-002)
  • Designet OPAX heavy mode: mode-parameter, modellfordeling, budsjettgrenser, whitelist
  • Oppdatert MASTERPLAN.md: ny LLM-RUTINGSSTRATEGI-seksjon med OPAX Heavy Mode (linje 309-384)
  • Oppdatert masterplan-summary.md: LLM-rutingsstrategi-tittel + OPAX heavy mode-notat
  • Fikset setup_corpus.py: byttet fra Spanner/RagVectorDbConfig til Serverless (ingen backend_config)

open_tasks:

  • Kjoere setup_corpus.py paa nytt etter backend_config-fjerning og verifisere RAG-indeksering
  • Verifisere at agent svarer korrekt paa 'OPAX heavy mode'-sporsmal etter re-indeksering
  • Implementere mode-parameteret i agent.py / models.py (RunRequest + get_models_for_mode)
  • Legge til HEAVY_MODE_ALLOWED_USERS-guard i agent.py
  • Oppdatere .env med HEAVY_*-variabler
  • Phase 4: Docs hardening (LEARNINGS.md, SECRETS-SETUP.md, IAP-SETUP.md)
  • Phase 5: IAP paa opax.vauco.no

decisions:

  • OPAX faar eksplisitt mode-parameter (standard/heavy) per request - ikke global toggle
  • Heavy mode autorisert kun for user_id: opax, admin
  • Budsjettgrense heavy mode: $10/dag (vs $3/dag standard), hard stopp $3 per oppgave
  • RAG Engine: Serverless mode (ingen backend_config) erstatter Spanner - unngaar allowlist-krav
  • Primaeregion forblir us-central1 for aa dekke alle modeller inkl. gemini-3.5-flash
  • us-east1 droppes som region for RAG (Spanner-kapasitetsproblem)

skills_used:

  • Python linje-for-linje filoppdatering via Cloud Shell
  • Vertex AI RAG Engine API (RagVectorDbConfig, Serverless mode)
  • Cloud Run /run endpoint curl-testing
  • MASTERPLAN.md-arkitektur og dokumentasjon

next_action: > Kjore python3 agents/rag/setup_corpus.py (etter backend_config-fjerning) og verifisere at RAG returnerer korrekt svar paa 'Hva er OPAX heavy mode?'. Deretter implementere mode-parameter i agent.py.