Pipeline d’ingestion
Transformer des sources hétérogènes en mémoire canonique sans perdre la provenance.
Étapes
Acquire
Recevoir fichier, URL, saisie, événement ou synchronisation de connecteur.
Normalize
Extraire texte, métadonnées, structure et médias pertinents.
Classify
Identifier domaine, Espace potentiel, entités et sensibilité.
Extract
Extraire des unités de connaissance candidates avec références à la source.
Resolve
Comparer aux mémoires existantes : nouveau, confirme, précise, contredit, remplace.
Route
Appliquer le schéma, le pilier et les politiques d’Espace.
Persist
Stocker source, mémoire, relations, provenance et index.
Recompute
Recalculer qualité, CU, recommandations de compression et état du graphe.
Idempotence
Chaque job d’ingestion doit disposer d’une clé stable permettant de rejouer sans dupliquer des mémoires.
Reprocessing
Les extracteurs et modèles évolueront. Orbit doit pouvoir retraiter une source historique avec une nouvelle version tout en conservant les résultats précédents jusqu’à validation.
Échec partiel
Une source peut être téléchargée mais échouer à l’extraction. Le pipeline doit enregistrer des statuts distincts plutôt qu’un booléen global “success”.