Logo DGTL Performance
DGTL Performance
CDI

Data Engineer PySpark (H/F)

DGTL Performance

📍 Localisation
Paris (75)
💰 Rémunération
45-50K
💼 Expérience
5 ans minimum

À propos

DGTL / Signe + est le facilitateur pour tous les acteurs qui recherchent des ressources ou des missions DATA.

Spécialiste du marché Data et BI, nous intervenons dans toute la France comme à l'étranger ; en sous-traitance, pré-embauche, recrutement, portage commercial, portage salarial, etc.

Depuis 2018, nous accompagnons nos clients avec proximité, juste prix et préoccupation éthique de tous les instants.

https://www.dgtl-performance.com

Le poste

Nous recherchons un Data Engineer confirmé pour rejoindre l'équipe de la Direction des Systèmes d'Information au sein d'un grand groupe industriel. Vous serez responsable de la conception, du développement et de la maintenance d'un datalake stratégique, en travaillant étroitement avec les équipes de production applicative et DevOps pour mettre en œuvre des solutions de traitement de données robustes et performantes.

Votre mission s'inscrit dans un environnement technologique moderne et agile. Vous participerez à l'évolution continue d'une plateforme données complexe, contribuerez à l'architecture des pipelines ETL et assurerez la qualité et la fiabilité des ingestions de données. L'environnement de travail est collaborative, dynamique et fondé sur les bonnes pratiques d'ingénierie logicielle (versioning, intégration continue, tests automatisés).

Le datalake traite des volumes de données significatifs et nécessite une expertise technique pointue. Vous aurez l'occasion de travailler sur des sujets variés : conception de schémas de données, optimisation des performances, debugging en environnement distribué, et exploration de nouvelles technologies pour améliorer la stack existante.

Responsabilités :
- Mettre en œuvre et industrialiser de nouvelles ingestions de données, en respectant les standards de qualité et de performance du datalake
- Concevoir et développer des transformations de données complexes en PySpark et Hive, optimisées pour les environnements Hadoop
- Maintenir, documenter et faire évoluer les outils et scripts de gestion des pipelines de données (PySpark, shell scripting Unix/Linux)
- Collaborer avec l'équipe DevOps pour l'évolution et l'optimisation de l'infrastructure de la plateforme données
- Rédiger des spécifications techniques détaillées et participer à la validation des livrables avec les parties prenantes
- Identifier et proposer des améliorations technologiques pour maintenir la compétitivité de la plateforme
- Travailler en méthodologie Agile/Scrum, participer aux cérémonies d'équipe et contribuer à l'amélioration continue
- Assurer le debugging et la résolution d'incidents en production, en coordination avec les équipes de support

Profil recherché

Indispensables :
- Maîtrise experte de PySpark et de la plateforme Hadoop (architecture, écosystème, déploiement)
- Très bonne maîtrise de Python, avec capacité à écrire du code production performant et maintenable
- Très bonne maîtrise de SQL et de Hive, incluant l'optimisation de requêtes et la gestion des tables distribuées
- Solide expérience du shell scripting sous environnement Unix/Linux pour l'automatisation et la gestion des pipelines
- Pratique confirmée de Git, Jenkins et des outils de gestion de projet (Jira ou équivalent)
- Expérience en environnement Agile/Scrum, avec capacité à s'adapter à un rythme de travail itératif
- Très bonne maîtrise de l'anglais, écrit et oral, pour collaborer avec des équipes distribuées
- Capacité à rédiger des spécifications techniques claires, précises et facilement compréhensibles
- Autonomie, proactivité et capacité à résoudre des problèmes complexes de manière indépendante
- Excellent relationnel et forte capacité à travailler en équipe multidisciplinaire

Fortement appréciés :
- Expérience avec des outils de traitement de données alternatifs ou complémentaires : Alteryx, Indexima, Altair
- Connaissance de Google Cloud Platform (GCP) et de BigQuery, ou expérience sur des solutions cloud de big data
- Maîtrise de bibliothèques Python avancées pour les API et l'intégration de systèmes (requests, pandas, pyspark-sql)
- Expérience dans la conception et l'optimisation d'architectures ETL à grande échelle
- Sensibilité aux bonnes pratiques de data governance, de sécurité des données et de qualité
- Curiosité technique et intérêt manifeste pour explorer et évaluer de nouvelles technologies
- Expérience avec des outils de monitoring et de logging en environnement distribué

Avantages

selon profil

Cette offre vous correspond ?

Postulez dès maintenant en nous envoyant votre CV !

💬 Pour personnaliser votre message au recruteur cliquez ici !

En cliquant sur postuler, j'accepte que les informations saisies soient transmises au recruteur et exploitées dans le cadre de la gestion des candidatures. Conformément à la loi "informatique et libertés", vous pouvez exercer votre droit d'accès aux données vous concernant et les faire rectifier en nous contactant: jobposting.pro/contact
En savoir plus sur notre politique de protection des données.

CDI · Data Engineer PySpark (H/F) 📍Paris · 💰45-50K
Postuler