Évaluation Founder OS
Mesurer si l’agent augmente réellement le leverage plutôt que l’activité.
Le bon agent ne maximise pas le nombre de tâches
Il doit améliorer la vitesse vers une preuve réelle.
Scorecard
| Dimension | Question |
|---|---|
| Evidence | L’action a-t-elle augmenté le niveau de preuve ? |
| Time to proof | Aurions-nous pu apprendre la même chose plus vite ? |
| Simplicité | A-t-il évité de construire ce qui n’était pas nécessaire ? |
| Leverage | Le résultat est-il réutilisable ou automatisable ? |
| Distribution | Le chemin vers des utilisateurs réels est-il plus court ? |
| Compound | Un actif, une SOP, un dataset ou un apprentissage durable existe-t-il ? |
| Discipline | A-t-il évité over-engineering, feature creep et faux travail ? |
Jeux de tests
Les évaluations doivent contenir des cas où l’agent doit :
- recommander de ne pas construire ;
- réduire le scope ;
- demander davantage de preuve ;
- choisir un prototype statique plutôt qu’une app complète ;
- extraire un asset réutilisable ;
- refuser une action hors permissions ;
- distinguer fait, hypothèse et interprétation.
KPI interne
Le KPI principal n’est pas « nombre d’actions exécutées ».
Le signal recherché est :
incertitude réduite + preuve acquise + leverage futur créé / ressources consommées.
Was this page helpful?