Portfolio GitHub des projets réalisés dans le cadre de ma formation Data Engineer.
J’y documente des réalisations autour de la modélisation de données, des bases SQL et NoSQL, de l’industrialisation de pipelines, du cloud, du streaming, de l’orchestration et des applications data / IA.
Je construis des solutions data de bout en bout :
- analyse et structuration de données ;
- modélisation SQL / NoSQL ;
- pipelines ELT et qualité de données ;
- orchestration et automatisation ;
- APIs data et ML ;
- POC et MVP autour du RAG.
Langages & data
Python, SQL, PostgreSQL, MongoDB, Pandas, Polars, PySpark
Data engineering
dbt, Airbyte, Kestra, DuckDB, Docker, Redpanda, BentoML
Cloud & apps
AWS, FastAPI, Streamlit, Qdrant, LangChain
Passage d’un POC à un MVP conteneurisé avec API FastAPI, mémoire conversationnelle PostgreSQL, base vectorielle Qdrant Cloud, interface Streamlit et observabilité.
Stack : FastAPI, Streamlit, Qdrant, PostgreSQL, LangChain, Mistral, Docker
Repo : https://github.com/Dudukun1871/ocr-projet13-rag-mvp
Pipeline industrialisé sous Kestra pour agréger, tester et analyser des ventes issues de plusieurs sources Excel, avec contrôles qualité automatisés.
Stack : Kestra, DuckDB, Python, Pandas, PostgreSQL
Repo : https://github.com/Dudukun1871/ocr-projet10-bottleneck-pipeline
Pipeline ELT complet pour ingérer, transformer et fiabiliser des données météo, avec dbt, Airbyte, PostgreSQL et industrialisation AWS.
Stack : Airbyte, dbt, PostgreSQL, Python, AWS, Docker
Repo : https://github.com/Dudukun1871/ocr-projet08-greencoop-weather
Simulation de tickets clients, ingestion via Redpanda, traitement avec PySpark Structured Streaming, sorties Parquet/JSON et supervision.
Stack : Redpanda, PySpark, Docker Compose, Python
Repo : https://github.com/Dudukun1871/ocr-projet09-redpanda-pyspark-poc
Industrialisation d’un modèle ML sous forme d’API BentoML conteneurisée pour prédire la consommation énergétique de bâtiments.
Stack : scikit-learn, BentoML, Pydantic, Docker / Podman
Repo : https://github.com/Dudukun1871/ocr-projet06-energy_consumption_api
Migration de données médicales CSV vers MongoDB avec validation, indexation, rôles, tests d’intégrité et conteneurisation.
Stack : Python, MongoDB, PyMongo, Docker, Pandas
Repo : https://github.com/Dudukun1871/ocr-projet05-mongodb_migration
| Projet | Sujet | Compétences clés | Repo |
|---|---|---|---|
| P02 | Analyse de données éducatives | EDA, nettoyage, corrélations, recommandation pays | https://github.com/Dudukun1871/ocr-projet02-analyse-donnees-education |
| P03 | Base relationnelle immobilière | modélisation 3NF, SQL analytique, PostgreSQL | https://github.com/Dudukun1871/ocr-projet03-dataimmo-sql |
| P04 | Audit d’un entrepôt OLAP | rétro-ingénierie, logs, triggers, qualité des données | https://github.com/Dudukun1871/ocr-projet04-audit-supersmartmarket |
| P05 | Migration MongoDB | ETL, validation, index, sécurité, Docker | https://github.com/Dudukun1871/ocr-projet05-mongodb_migration |
| P06 | API ML énergie | ML serving, validation d’entrée, déploiement | https://github.com/Dudukun1871/ocr-projet06-energy_consumption_api |
| P07 | Analyse NoSQL Airbnb | MongoDB, Polars, réplication, sharding, Superset | https://github.com/Dudukun1871/ocr-projet07-airbnb_nosql_analysis |
| P08 | Infrastructure météo | ELT, Airbyte, dbt, PostgreSQL, AWS | https://github.com/Dudukun1871/ocr-projet08-greencoop-weather |
| P09 | Streaming temps réel | broker Kafka-compatible, PySpark, outputs analytics | https://github.com/Dudukun1871/ocr-projet09-redpanda-pyspark-poc |
| P10 | Orchestration BottleNeck | scheduling, tests qualité, DuckDB, Kestra | https://github.com/Dudukun1871/ocr-projet10-bottleneck-pipeline |
| P11 | RAG POC culturel | embeddings, FAISS, LangChain, Mistral | https://github.com/Dudukun1871/ocr-projet11-rag-opencalendar-poc |
| P12 | POC avantages sportifs | pipeline RH/sport, dbt, Streamlit, Superset, RGPD | https://github.com/Dudukun1871/ocr-projet12-sport-data-poc |
| P13 | RAG MVP | API, vector DB, mémoire, conteneurisation, observabilité | https://github.com/Dudukun1871/ocr-projet13-rag-mvp |
- Concevoir des modèles de données SQL et NoSQL
- Construire des pipelines fiables et testés
- Industrialiser des traitements data avec Docker et orchestration
- Exposer des services data / ML via API
- Passer d’un POC à un MVP plus robuste
- Prendre en compte qualité, sécurité, observabilité et RGPD
- GitHub : https://github.com/Dudukun1871