depuis la création du compte
Confiez votre projet à Julian
Faites appel à l'expertise de Julian pour faire avancer votre projet, ou découvrez d'autres freelances pour trouver celui qui correspondra parfaitement à vos besoins.
Qui je suis & Mon expertise
Ingénieur diplômé de Télécom Paris (Master Spécialisé en Intelligence Artificielle), j'interviens comme Consultant en IA Générative et Agentique. Mon objectif est d'accompagner les entreprises dans l'automatisation de leurs processus métier et la valorisation de leurs données textuelles et documentaires grâce aux technologies d'IA les plus récentes.
Ce que je sais faire (Mes compétences clés)
Mon expertise technique me permet de concevoir et de déployer des architectures IA de bout en bout, performantes, sécurisées et adaptées aux contraintes de production :
- IA Générative & Assistants Intelligents (LLM) : Conception de prompts avancés, intégration d'APIs (Azure OpenAI, Mistral AI, OpenAI) et développement de chatbots intelligents contextuels.
- Architectures RAG (Retrieval-Augmented Generation) : Mise en place de systèmes de recherche vectorielle sémantique pour connecter des modèles de langage à vos bases de connaissances ou catalogues produits internes.
- Traitement du Langage Naturel (NLP) & Structuration : Parsing automatisé, classification de textes, extraction d'entités (NER) et fine-tuning de modèles.
- Anonymisation & Conformité (RGPD) : Création de pipelines de masquage hybrides (règles déterministes / regex + LLM locaux) pour garantir la confidentialité et la sécurité des données sensibles avant leur traitement dans le cloud.
- Vision & OCR (Optical Character Recognition) : Extraction et structuration de données à partir de documents complexes (CV, factures, formulaires) via des solutions locales ou cloud (Amazon Textract, PP-OCR, Mistral OCR).
- Optimisation & Déploiement : Réalisation de benchmarks de performance (CPU/GPU) et optimisation de la latence d’inférence des modèles à l'aide d'outils comme ONNX Runtime ou TensorRT.
Ma méthode de travail
- Approche itérative et pragmatique : Je privilégie la création rapide de POC (Proof of Concept) pour tester la faisabilité technique d'une idée, valider sa pertinence métier et mesurer ses coûts opérationnels avant tout déploiement à grande échelle.
- Sens des contraintes de production : Je ne me contente pas de faire tourner des modèles. J'intègre dès le départ vos contraintes d'infrastructure (hébergement cloud ou local, optimisation GPU/CPU) et de sécurité informatique.
- Pédagogie et interface technique/métier : J'assure le lien entre vos besoins opérationnels et la complexité technique des algorithmes, en restituant des conclusions claires et chiffrées pour guider vos choix stratégiques.
Conception et implémentation de bout en bout de "PerSi", un chatbot vendeur personnalisé et adaptatif destiné à conseiller les clients internationaux en magasin sur tablette, selon leur profil culturel et leurs affinités.
Détails techniques et réalisations :
Architecture RAG Avancée : Indexation et recherche vectorielle sur le catalogue de produits et l'histoire de la marque via l'algorithme HNSW et Semantic Search (dérivé de Microsoft Bing) hébergé sur Azure Search, utilisant le modèle text-embedding-3-large.
Système multi-agent coopératif : Développement d'une chaîne LLM articulée autour d'un agent d'analyse client (mise à jour continue du profil utilisateur en JSON) et d'un agent vendeur Chanel chargé de générer la réponse personnalisée adaptée.
Modélisation culturelle : Intégration des critères de sensibilité culturelle de Hofstede (distance hiérarchique, individualisme, contrôle de l'incertitude...) couplés à un prompting dynamique (modèle OpenAI GPT-4o-mini) pour modifier en temps réel le ton et les recommandations du chatbot.
Interface utilisateur (UI) : Développement d’une interface de paramétrage et de démonstration interactive sous Streamlit intégrant des sliders de réglages précis, une carte interactive pour l'initialisation par pays, et des onglets d'analyse de conversation (produits recommandés et explications des changements de profils).
Pipeline d'évaluation (RAGAS) : Création d’un processus de validation s'appuyant sur un dataset de 125 questions de tests catégorisées (comparaisons de produits, cadeaux, soins, style) pour mesurer la fidélité de la génération (Faithfulness, pertinence des réponses) et la précision du contexte afin d'éradiquer les hallucinations.
Infrastructure & Déploiement : Orchestration de la chaîne LLM via le framework Prompt Flow, conteneurisation des services avec Docker (ACR) et déploiement cloud global sur l'écosystème Azure Foundry.
Audit, benchmark et optimisation de l’architecture de traitement automatique des CV (Parsing de documents multi-colonnes et complexes) afin de réduire la dépendance aux services cloud (AWS) et accélérer l’inférence locale.
Détails techniques et réalisations :
Analyse du pipeline existant : Analyse de la chaîne séquentielle associant Amazon Textract (extraction de texte et de bounding boxes normalisées) à un classifieur de lignes Transformer LiLT (Language-Independent Layout Transformer).
Étude comparative OCR : Réalisation d'un benchmark de qualité (métrique IoU pour l'appariement spatial, divergence textuelle et de position) pour comparer Amazon Textract face aux solutions locales PP-OCRv5 (Server/Mobile) et au VLM compact PaddleOCR-VL-1.5.
Optimisation matérielle (CPU vs GPU) : Mesure et validation des gains sur GPU NVIDIA L4, divisant le temps de traitement par page par 37,5.
Optimisation du classificateur LiLT : Exportation et compilation du modèle de Token Classification (nielsr/lilt-xlm-roberta-base avec head à 30 classes métier) vers ONNX Runtime et NVIDIA TensorRT.
Résultats de latence : Réduction drastique du temps d'inférence GPU L4, soit une accélération d'un facteur 167.
Conception et déploiement d’un pipeline de traitement automatique pour masquer les données personnelles (PII) et confidentielles de brouillons d'offres d'emploi avant leur envoi vers des LLM cloud pour parser ces informations.
Détails techniques et réalisations :
Architecture hybride : Combinaison d'expressions régulières (regex) pour les données normées (e-mails, téléphones, URL) et d'un LLM local pour les entités contextuelles (noms, entreprises, localisations, identifiants internes).
Pipeline à double passe : Implémentation d’une première étape de détection (LLM detect) suivie d’une étape d'audit des fuites résiduelles (LLM verify) pour maximiser la sécurité.
Modèle & Optimisation d’inférence : Choix et intégration du modèle Qwen3.5-9B quantifié en FP8 pour s'adapter aux contraintes de mémoire GPU.
Serveur d'inférence : Déploiement du modèle avec le framework vLLM (mode non-thinking, contexte à 8 192 tokens) interconnecté avec une API FastAPI pour la gestion des règles métiers et du format de sortie JSON strict.
Sécurité applicative : Mise en place d’un scanner amont anti-injection de prompt (jailbreaks, altérations de balises ou de consignes système).
Évaluation de performances : Création d'un protocole d’évaluation sur un dataset de 500 offres annotées à la main, atteignant une précision globale de 99,7 % après correction de la vérité terrain.