14 oktober 2025
SUTS: en extern testsuite för självmodellerad AI
Hur vi mäter självförståelse i AI med kalibrering, risk–coverage och driftdetektion.
SUTS självmodellering osäkerhet antifragilitet
Sammanfattning. SUTS är en extern testsuite som mäter självförståelse hos AI-modeller. I stället för att en modell bara påstår sin säkerhet, prövas den mot oberoende mått och scenarier.
Varför SUTS?
- Kalibrering: sannolikheter bör motsvara verkliga utfall (ECE/Brier).
- Risk–coverage: hur mycket kan automatiseras givet en felrisk?
- OOD/drift: upptäck när datan ändras och hur snabbt systemet reagerar.
- Stabilitet: beslut ska vara robusta mot små, semantiska perturbationer.
Minimalt protokoll
- Grundmätning: träffsäkerhet + ECE på valideringsdata.
- Stress: skapa distribution-skiften (t.ex. tidsfönster, brus, motexempel).
- Risk–coverage-kurva: mät kvalitet vid olika abstain-trösklar.
- Återhämtning: test-time anpassning inom safety envelope + mät förbättring.
När använda?
- Innan produktion (acceptanskriterier).
- Vid större modell- eller databyten.
- Regelbundet som del av revision och efterlevnad.
Arbetspapper och referenskod publiceras löpande i våra publikationer.