Skip to content
retour aux projets
01

supply-chain-etl-ml

Pipeline, modèle et restitution
environnement
chaîne complète ETL → ML → BI
temps
projet personnel
contexte
supply chain

// pourquoi

Un projet analytique de bout en bout qui transforme des événements bruts de chaîne logistique en entrepôt cloud, entraîne un modèle de prédiction du risque de retard, et restitue le tout dans Power BI.

Pourquoi ce projet
Réduire le coût des livraisons tardives en signalant les commandes à risque en amont.
Prioriser les opérations par pays et par transporteur, en croisant risque et volume.
Améliorer la tenue des SLA en se concentrant sur les faux négatifs, c'est-à-dire les retards manqués.
Architecture
ETL Python (extraction et nettoyage CSV) → PostgreSQL Neon (schéma en étoile) → modèle Scikit-Learn → table de prédictions → vue BI → tableau de bord Power BI.
Dimensions : date, client, produit, statut de commande, mode d'expédition, marché. Table de faits : fact_order_item. Sorties ML : ml_predictions_order_item et la vue consolidée vw_bi_ml_orders.
Performance du modèle
RandomForest, modèle principal : précision ~0,73, confirmée par validation croisée 5 folds (~0,73 en moyenne, faible variance).
Régression logistique et XGBoost léger testés en référence : tous deux en retrait sur ce jeu de données.
Améliorations prévues
Réglage du seuil de probabilité à partir d'une matrice de coûts métier, optimisation des hyperparamètres, pipeline de réentraînement automatisé et règles de qualité sur la cohérence géospatiale.

// outils

PythonPostgreSQLScikit-LearnPower BINeonSQL

// code

githublotfi8rbh/supply-chain-etl-ml