Inférence batch & streaming¶
Pour scorer en continu, ajoutez une étape d'inférence dans un Data Flow. Elle appelle le modèle exposé (Model Serving) et écrit les résultats scorés — en batch (table Iceberg) ou en streaming (topic Kafka + alertes).
Deux modes¶
Un flux lit les transactions, appelle le serving, écrit une table scored avec le fraud_score.
flowchart LR
T[(Transactions)]:::src --> I[Score fraude<br/>serving]:::tf --> W[(scored · Iceberg)]:::sink
classDef src fill:#eef6f2,stroke:#17987a
classDef tf fill:#fff6e6,stroke:#e3a63c
classDef sink fill:#eaf0f4,stroke:#0e2233
Un flux consomme un topic Kafka, score chaque message et publie les fraudes vers un topic d'alertes.
flowchart LR
K[(Kafka transactions)]:::src --> I[Score fraude<br/>serving]:::tf
I --> W[(scored · Iceberg)]:::sink
I --> A[(alertes · Kafka)]:::alert
classDef src fill:#eef6f2,stroke:#17987a
classDef tf fill:#fff6e6,stroke:#e3a63c
classDef sink fill:#eaf0f4,stroke:#0e2233
classDef alert fill:#fdeceb,stroke:#b42318
Procédure¶
- Ouvrez (ou créez) un Data Flow dans le bon mode (Batch / Streaming).
- Ajoutez un Transform → Inférence et pointez-le vers le serving déployé (interne, ClusterIP).
- Reliez : Source → Inférence → Écriture(s).
- Déployer puis Démarrer ; suivez les Runs.
De l'inférence à la traçabilité¶
IA auditable
Brancher l'inférence dans un Data Flow présente un double avantage : le scoring s'industrialise (batch ou streaming) et le flux enregistre automatiquement son lineage — on sait quelles données ont alimenté quel modèle et où sont parties les prédictions. C'est la base d'une IA auditable (cf. Gouvernance).
Fin du parcours Data Scientist. Suivant : Métier — Décider →