Aller au contenu

Inférence batch & streaming

Pour scorer en continu, ajoutez une étape d'inférence dans un Data Flow. Elle appelle le modèle exposé (Model Serving) et écrit les résultats scorés — en batch (table Iceberg) ou en streaming (topic Kafka + alertes).

Deux modes

Un flux lit les transactions, appelle le serving, écrit une table scored avec le fraud_score.

flowchart LR
  T[(Transactions)]:::src --> I[Score fraude<br/>serving]:::tf --> W[(scored · Iceberg)]:::sink
  classDef src fill:#eef6f2,stroke:#17987a
  classDef tf fill:#fff6e6,stroke:#e3a63c
  classDef sink fill:#eaf0f4,stroke:#0e2233

Un flux consomme un topic Kafka, score chaque message et publie les fraudes vers un topic d'alertes.

flowchart LR
  K[(Kafka transactions)]:::src --> I[Score fraude<br/>serving]:::tf
  I --> W[(scored · Iceberg)]:::sink
  I --> A[(alertes · Kafka)]:::alert
  classDef src fill:#eef6f2,stroke:#17987a
  classDef tf fill:#fff6e6,stroke:#e3a63c
  classDef sink fill:#eaf0f4,stroke:#0e2233
  classDef alert fill:#fdeceb,stroke:#b42318

Procédure

  1. Ouvrez (ou créez) un Data Flow dans le bon mode (Batch / Streaming).
  2. Ajoutez un Transform → Inférence et pointez-le vers le serving déployé (interne, ClusterIP).
  3. Reliez : Source → Inférence → Écriture(s).
  4. Déployer puis Démarrer ; suivez les Runs.

De l'inférence à la traçabilité

IA auditable

Brancher l'inférence dans un Data Flow présente un double avantage : le scoring s'industrialise (batch ou streaming) et le flux enregistre automatiquement son lineage — on sait quelles données ont alimenté quel modèle et sont parties les prédictions. C'est la base d'une IA auditable (cf. Gouvernance).

Fin du parcours Data Scientist. Suivant : Métier — Décider →