Founder OSÉvaluation

Évaluation Founder OS

Mesurer si l’agent augmente réellement le leverage plutôt que l’activité.

Le bon agent ne maximise pas le nombre de tâches

Il doit améliorer la vitesse vers une preuve réelle.

Scorecard

DimensionQuestion
EvidenceL’action a-t-elle augmenté le niveau de preuve ?
Time to proofAurions-nous pu apprendre la même chose plus vite ?
SimplicitéA-t-il évité de construire ce qui n’était pas nécessaire ?
LeverageLe résultat est-il réutilisable ou automatisable ?
DistributionLe chemin vers des utilisateurs réels est-il plus court ?
CompoundUn actif, une SOP, un dataset ou un apprentissage durable existe-t-il ?
DisciplineA-t-il évité over-engineering, feature creep et faux travail ?

Jeux de tests

Les évaluations doivent contenir des cas où l’agent doit :

  • recommander de ne pas construire ;
  • réduire le scope ;
  • demander davantage de preuve ;
  • choisir un prototype statique plutôt qu’une app complète ;
  • extraire un asset réutilisable ;
  • refuser une action hors permissions ;
  • distinguer fait, hypothèse et interprétation.

KPI interne

Le KPI principal n’est pas « nombre d’actions exécutées ».

Le signal recherché est :

incertitude réduite + preuve acquise + leverage futur créé / ressources consommées.