Profile Photo

Cristian GHITU

Data Scientist | Machine Learning Engineer

Data Scientist et Machine Learning Engineer avec plus de 6 ans d'expérience dans le secteur bancaire, spécialisé dans la réalisation de bout en bout d'applications ML et Big Data.
Capacité avérée à faire le lien entre les enjeux métiers et l'exécution technique, de la phase de cadrage jusqu’à la construction de pipelines de données industrialisés.
Expertise en Python, Scala et Apache Spark dans un environnement Big Data, avec une forte orientation vers l'industrialisation de cas d’usage Data Science.

Do I Match ?

Vous êtes recruteur ? Cet outil vous aide à tester si mon profil correspond à votre descriptif de mission ! Essayez-le !

Expérience Professionnelle

Créateur de cours. Projets personnels et sabbatique

Projet indépendant • 2024 - Présent

GenAI et LLMs : Construction d'application qui vérifie la correspondance entre un descriptif de mission et le CV d'un candidat en fournissant un résumé et un ensemble d'arguments justifiant sa décision. Le projet utilise LangChain comme interface générique pour des modèles LLM (testé avec des modèles fournis par OpenAI) avec sortie structurée. FastAPI est utilisé pour permettre les requêtes API et Streamlit pour l'interface graphique.
Construction d'un projet similaire analysant des descriptions issues de certains job boards en les comparant au profil d'un candidat, avec la possibilité de chercher les détails de l'entreprise en cas de succcès. Technologies et services utilisés : Python, Selenium, LangChain, OpenAI, Tavily.

Création de cours en ligne : Conception et création d'un cours en ligne d'introduction au langage Scala, comprenant vidéos, supports de présentation, exercices interactifs et quiz.

Implémentation technique : Développement de tests unitaires en Scala pour évaluer les solutions des étudiants. Utilisation de l'interface de la plateforme hôte pour implémenter des quiz auto-évalués.

Upskilling : Obtention de la certification AWS Cloud Practitioner. Montée en compétences sur les outils modernes de ML Engineering et GenAI, notamment Docker (containerisation), GitHub Actions (CI/CD), Apache Airflow (orchestration), FastAPI (APIs, service de modèles), Streamlit (applications web), PyTorch, LangChain, LangGraph (LLM et Agents IA).

Data Scientist

Société Générale • 2017 - 2024

Cadre Agile : Réalisation de projets de Data Science au sein d'équipes Agiles utilisant la méthodologie Scrum, en contribuant aux projets de la phase de cadrage jusqu'à leur industrialisation.

Projets clés :

Estimation (score) de risque : Création de pipelines de données et de prédiction industrialisés pour calcul de scores de risque.
Nettoyage, préparation et feature engineering sur de vastes jeux de données avec PySpark et entraînement de modèles avec scikit-learn, Hyperopt et d'autres librairies ML, en utilisant les valeurs de Shapley pour expliquer les prédictions.
Structuration du code de traitement des données en pipelines modulaires à l'aide de Kedro, avec l'utilisation de Great Expectations pour les contrôles qualité. Utilisation de MLflow pour le versionning des modèles et le suivi des performances à travers différentes itérations.

Automatisation de traitement de transactions : Création de modèle de scoring industrialisé ayant permis de réduire le temps passé par les conseillers bancaires sur le traitement de certaines transactions bancaires.
Traduction de code Python exploratoire en code Scala industrialisé.

Calcul de KPIs réglementaires : Traitement de données tabulaires massives avec PySpark pour le calcul d’indicateurs réglementaires.

Détection d'anomalies de facturation : Application de modèles non-supervisés pour la détection d’anomalies sur des lignes de facturation.

Classification d'incidents informatiques (PoC) : Application de techniques de traitement de langage naturel (NLP) pour grouper et classer les incidents informatiques par thématique.
Utilisation d’Apache Spark et Scala avec les librairies OpenNLP et StanfordNLP pour distribuer le traitement et réduire le temps d’exécution du prétraitement de texte.

Conventions et partage :

Standardisation : Mise en place de standards pour le déroulement de projets ML afin d’accélérer la transition de PoCs (notebooks Jupyter) vers des applications industrialisées, en établissant des conventions pour le code exploratoire.

Accompagnement et REX : Partage de connaissances et organisation de rencontres internes et externes en tant que membre de communautés de développeurs. Accompagnement de stagiaires et juniors pendant leur onboarding.

Intervenant de cours : Scala et Apache Spark

Enseignement Supérieur • 2022 - Présent

Intervention dans le cadre d’un cours d’introduction au langage Scala à un public de plus de 300 étudiants dans le cadre de formations en Data Science et Data Engineering. Dispensé en Anglais et Français.

Data Science - Stage PFE

Société Générale • 2017

Exploration et application d’algorithmes de détection d’anomalies sur des séries temporelles issues de logs applicatives dans le but de permettre la maintenance prédictive de serveurs applicatifs. Méthodes explorées : modèle de Taylor à double saisonnalité, LSTMs et auto-encodeurs en utilisant Python et Keras.

Formation et Certifications

Diplôme d'Ingénieur, Génie Informatique

Université de Technologie de Compiègne (UTC), France • 2012 - 2017

AWS Certified Cloud Practitioner

Amazon Web Services • Obtenu en 2025

Compétences

Python Scala SQL Java Apache Spark Hadoop Cloudera AWS Kedro Great Expectations Apache Airflow PyTorch pandas scikit-learn XGBoost keras H2O SHAP MLflow LangChain LangGraph FastAPI Docker Dataiku Git JIRA

Connectons-nous sur LinkedIn !

Pour échanger des idées, parler d'opportunités ou tout simplement garder contact !