OpérationsFiabilité & SLO

Fiabilité & SLO

Objectifs de service et stratégies de dégradation pour un Context OS disponible.

SLO initiaux à définir avant production

  • disponibilité lecture contexte ;
  • p95 / p99 de orbit.context() ;
  • délai de synchronisation des connecteurs ;
  • taux de succès des workflows d’ingestion ;
  • RPO/RTO ;
  • taux d’erreur des writes.

Les valeurs exactes seront choisies avec les contraintes réelles du produit.

Dégradation gracieuse

Si un provider IA est indisponible :

  • les lectures de mémoires existantes doivent continuer si possible ;
  • les writes peuvent entrer en file ;
  • la compression peut être différée ;
  • le graphe doit distinguer “stale” de “unavailable”.

Retries

Retry uniquement les opérations idempotentes ou munies d’une clé d’idempotence.

Utiliser backoff et jitter pour éviter les tempêtes de reprise.