Data Engineer Python H/F – MCO d'une IA d'extraction documentaire (secteur industriel)
Description de la mission
Notre client, un grand groupe industriel français, dispose d'une fonction d'édition logicielle interne chargée d'industrialiser et de maintenir en conditions opérationnelles des intelligences artificielles développées par ses équipes de R&D.
Nous recherchons un ou une Data Engineer pour assurer le maintien en conditions opérationnelles (MCO) d'une IA d'extraction de texte à partir de documents industriels (plans, schémas techniques), utilisée pour indexer et fiabiliser un patrimoine documentaire à grande échelle. L'outil doit absorber une forte montée en charge dans les années à venir (plusieurs dizaines de millions de pages).
Missions
Assurer la MCO corrective (traitement des incidents, petits développements, remédiations)
Suivre et sécuriser les traitements en lots et en flux continu, avec un objectif de taux d'erreur maîtrisé
Analyser les erreurs, lancer des rejeux, proposer des correctifs
Optimiser la stratégie d'utilisation des ressources de calcul HPC (soumission de jobs, gestion des files d'attente, tuning de code)
Anticiper les besoins futurs en ressources de calcul et proposer des feuilles de route d'optimisation
Améliorer en continu l'outillage de monitoring (logs, erreurs, métrologie)
Profil recherché
Profil recherché
Expérience confirmée en Data Engineering, idéalement sur des problématiques de traitement documentaire ou d'extraction de texte (OCR, parsing, structuration)
Maîtrise de Python (niveau expert requis, test technique à prévoir)
Une expérience sur environnement de calcul HPC (ordonnanceur type Slurm) et/ou architecture GPU est un vrai plus
Bonnes pratiques de développement et qualité de code (tests, documentation, débogage)
Autonomie, capacité à interagir directement avec les interlocuteurs métier
Qualité de la mission
L'échelle du défi technique : il ne s'agit pas de MCO basique, mais de sécuriser une montée en charge à 60 millions de pages sur 2027-2028, ce qui donne une vraie dimension "performance et scalabilité" au poste.
Le volet HPC est valorisant : travailler sur des calculateurs HPC (avec tuning de code, optimisation de la stratégie de soumission de jobs, étude de portage vers un second calculateur) sort du Data Engineering classique et permet de développer une expertise rare et recherchée.
Un vrai rôle de contributeur, pas juste d'exécutant : le CCAP demande explicitement d'être force de proposition (feuilles de route d'optimisation, audits de code, ateliers avec le SI Scientifique), donc le candidat a de la latitude pour améliorer l'outil, pas seulement le maintenir.
Contexte R&D d'un grand groupe industriel : travailler au sein d'une fonction R&D sur un sujet IA appliqué à un patrimoine documentaire stratégique (nucléaire) est un contexte porteur pour le CV.
Souplesse organisationnelle : télétravail possible jusqu'à 50%, avec un cadre "pas de SLA strict" sur la partie corrective, ce qui laisse de la respiration par rapport à des missions de run pur.