104 lines
2.7 KiB
Markdown
104 lines
2.7 KiB
Markdown
|
|
# SIL Hypoteser
|
||
|
|
|
||
|
|
> "Vilka hypoteser försöker vi falsifiera?"
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## H1: SIL minskar regressionsfel med minst 20%
|
||
|
|
|
||
|
|
**Mätning:**
|
||
|
|
- Baseline: Regressionsfrekvens utan SIL (vecka 1-2)
|
||
|
|
- Med SIL: Regressionsfrekvens med SIL (vecka 3-8)
|
||
|
|
- Jämför: (baseline - med_SIL) / baseline
|
||
|
|
|
||
|
|
**Falsifiering:**
|
||
|
|
- Om regressionsfrekvens INTE minskar med ≥20% → H1 falsifierad
|
||
|
|
|
||
|
|
**Konsekvens:**
|
||
|
|
- Om falsifierad: SIL:s impact-analysis är för svag. Förbättra graf eller regler.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## H2: SIL upptäcker fler arkitekturöverträdelser än traditionell code review
|
||
|
|
|
||
|
|
**Mätning:**
|
||
|
|
- Räkna överträdelser som hittades av code review men INTE av SIL
|
||
|
|
- Räkna överträdelser som hittades av SIL men INTE av code review
|
||
|
|
- Jämför antal
|
||
|
|
|
||
|
|
**Falsifiering:**
|
||
|
|
- Om code review hittar fler överträdelser än SIL → H2 falsifierad
|
||
|
|
|
||
|
|
**Konsekvens:**
|
||
|
|
- Om falsifierad: Arkitekturpolicyerna är för svaga eller för få.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## H3: SIL hittar fler beroenden än en senior utvecklare
|
||
|
|
|
||
|
|
**Mätning:**
|
||
|
|
- Jämför SIL:s förutsägelser med senior utvecklares manuell analys
|
||
|
|
- Räkna true positives, false positives, false negatives
|
||
|
|
|
||
|
|
**Falsifiering:**
|
||
|
|
- Om senior utvecklare har högre recall än SIL → H3 falsifierad
|
||
|
|
|
||
|
|
**Konsekvens:**
|
||
|
|
- Om falsifierad: Grafen saknar relationer eller fil-mappning är felaktig.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## H4: Confidence korrelerar med faktisk korrekthet
|
||
|
|
|
||
|
|
**Mätning:**
|
||
|
|
- Bin confidence i intervall (0.5-0.6, 0.6-0.7, etc.)
|
||
|
|
- För varje bin: beräkna faktisk accuracy
|
||
|
|
- Jämför: |förväntad_confidence - faktisk_accuracy| < 10%
|
||
|
|
|
||
|
|
**Falsifiering:**
|
||
|
|
- Om kalibreringsfelet > 10% i flera bin → H4 falsifierad
|
||
|
|
|
||
|
|
**Konsekvens:**
|
||
|
|
- Om falsifierad: Confidence-modellen är felkalibrerad. Justera algoritm.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## H5: UNKNOWN används när systemet faktiskt saknar tillräcklig evidens
|
||
|
|
|
||
|
|
**Mätning:**
|
||
|
|
- När SIL säger UNKNOWN: verifiera om det verkligen saknades evidens
|
||
|
|
- När SIL säger CERTAIN men har fel: hade det saknats evidens?
|
||
|
|
|
||
|
|
**Falsifiering:**
|
||
|
|
- Om UNKNOWN används när det fanns tillräcklig evidens → H5 falsifierad
|
||
|
|
- Om CERTAIN används när evidens saknades → H5 falsifierad
|
||
|
|
|
||
|
|
**Konsekvens:**
|
||
|
|
- Om falsifierad: Osäkerhetsmodellen är för konservativ eller för aggressiv.
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
## Experimentdesign
|
||
|
|
|
||
|
|
### Vecka 1-2: Baseline
|
||
|
|
- Kör utan SIL (eller med SIL i skuggläge utan att visa resultat)
|
||
|
|
- Samla data för H1, H2, H3
|
||
|
|
|
||
|
|
### Vecka 3-6: Med SIL
|
||
|
|
- Aktivera SIL för utvecklare (opt-in)
|
||
|
|
- Samla samma data
|
||
|
|
- Jämför
|
||
|
|
|
||
|
|
### Vecka 7-8: Analys
|
||
|
|
- Beräkna alla hypoteser
|
||
|
|
- Klassificera fel (Failure Review)
|
||
|
|
- Kalibrera confidence
|
||
|
|
|
||
|
|
### Vecka 9: Beslut
|
||
|
|
- Go/no-go för full aktivering
|
||
|
|
- Prioritera förbättringar baserat på falsifierade hypoteser
|
||
|
|
|
||
|
|
---
|
||
|
|
|
||
|
|
*"Det är en stor mental skillnad att fråga 'Vilka hypoteser försöker vi falsifiera?' istället för 'Vad kan vi bygga mer?'"*
|