Data Engineer RD-017
Data Engineer (Mid-level) Location: Remote (Quebec/Canada) About Irth Solutions Irth Solutions is a leading provider of cloud-based SaaS software for damage prevention, asset integrity, stakeholder engagement and land management, helping energy, utility, telecom, and infrastructure companies protect their critical network infrastructure. With nearly three decades of industry experience, Irth serves customers across North America and continues to expand its platform with new data-driven and AI-powered capabilities. About the Role We are looking for a Data Engineer to design, build, and maintain data ingestion and processing pipelines in Databricks, transforming high-volume external data sources into clean, structured, reliable inputs for downstream analysis and intelligence. This role will primarily support our Stakeholder Engagement offering, working closely with our Data Scientist and application teams. Key responsibilities 1. Data Pipeline Development (Primary Responsibility)
- Design, build, and maintain ingestion pipelines from high-volume external APIs, capable of running continuously and reliably at scale.
- Implement ingestion and transformation workflows using Databricks (Spark/PySpark, SQL, Delta Live Tables), applying medallion architecture patterns (Bronze → Silver → Gold) to move from raw ingested content to clean, structured, analysis-ready data.
- Build the infrastructure for deduplication and relevance filtering of incoming content, implementing filtering logic and quality criteria defined in collaboration with the Data Scientist.
- Implement schema evolution handling and data validation rules as data sources and formats change over time.
- Configure and manage Delta Lake storage structures, tables, partitions, and optimization routines (OPTIMIZE, Z-ORDER, VACUUM).
- Design and evolve data schemas that balance query performance, cost, and maintainability as data volume grows.
- Maintain clear metadata and documentation of table structures to support easy consumption by the Data Science and application teams.
- Ensure pipeline reliability and observability: error handling, retries, monitoring, and alerting for a continuously running system.
- Adapt pipelines to evolving external API contracts, rate limits, authentication changes, and new data sources.
- Troubleshoot pipeline failures, perform recovery, and tune performance as needed.
- Build, schedule, and monitor workflows using Databricks Workflows, Delta Live Tables, or similar orchestration tools.
- Contribute to CI/CD pipelines for code deployment, versioning, and environment management.
- Work closely with the Data Scientist to expose clean, well-structured data feeding LLM/NLP pipelines and downstream models.
- Participate in technical decisions around data architecture and propose structuring solutions as the team's needs evolve.
- Document pipelines, data dictionaries, job schedules, and transformation logic.
- Support the onboarding of new data sources and pipelines as the product expands to additional solution areas.
- Concevoir, construire et maintenir des pipelines d'ingestion à partir d'API externes à haut volume, capables de fonctionner de façon continue et fiable à grande échelle.
- Implémenter des flux d'ingestion et de transformation avec Databricks (Spark/PySpark, SQL, Delta Live Tables), en appliquant les patrons d'architecture medallion (Bronze → Silver → Gold) pour transformer le contenu brut ingéré en données propres, structurées et prêtes pour l'analyse.
- Construire l'infrastructure de déduplication et de filtrage de pertinence du contenu entrant, en implémentant la logique de filtrage et les critères de qualité définis en collaboration avec le data scientist.
- Implémenter la gestion de l'évolution des schémas et des règles de validation des données, à mesure que les sources et formats de données évoluent.
- Configurer et gérer les structures de stockage Delta Lake, les tables, le partitionnement et les routines d'optimisation (OPTIMIZE, Z-ORDER, VACUUM).
- Concevoir et faire évoluer des schémas de données qui équilibrent performance des requêtes, coûts et facilité de maintenance à mesure que le volume de données croît.
- Maintenir une documentation claire des métadonnées et des structures de tables afin de faciliter leur utilisation par les équipes de data science et de développement applicatif.
- Assurer la fiabilité et l'observabilité des pipelines : gestion des erreurs, mécanismes de reprise (retries), surveillance et alertes pour un système fonctionnant en continu.
- Adapter les pipelines aux changements des contrats d'API externes, des limites de taux (rate limits), des méthodes d'authentification et à l'ajout de nouvelles sources de données.
- Diagnostiquer les défaillances des pipelines, effectuer les reprises nécessaires et optimiser la performance au besoin.
- Construire, planifier et surveiller des flux de travail avec Databricks Workflows, Delta Live Tables ou des outils d'orchestration équivalents.
- Contribuer aux pipelines CI/CD pour le déploiement du code, la gestion des versions et des environnements.
- Collaborer étroitement avec le data scientist pour fournir des données propres et bien structurées alimentant les pipelines LLM/NLP et les modèles en aval.
- Participer aux décisions techniques liées à l'architecture des données et proposer des solutions structurantes à mesure que les besoins de l'équipe évoluent.
- Documenter les pipelines, les dictionnaires de données, les calendriers d'exécution et la logique de transformation.
- Appuyer l'intégration de nouvelles sources et pipelines de données à mesure que le produit s'étend à d'autres domaines de solutions.
- 3 to 5 years of experience in data engineering, with solid experience building and operating production-grade data pipelines.
- Familiarity with data modeling, data quality, and schema evolution.
- Solid understanding of data pipeline reliability practices: monitoring, alerting, and handling failures gracefully in a continuously running system.
- Hands-on experience with Databricks (or an equivalent Spark-based environment): schema design, Delta Lake, performance tuning, and pipeline orchestration.
- Experience with at least one major cloud (Azure preferred; AWS/GCP also beneficial).
- Experience integrating with external APIs at scale: authentication, pagination, rate limiting, retries, error handling.
- Strong proficiency in Python and SQL
- Comfortable working with unstructured/semi-structured text data at scale.
- LLM prompting experience and/or basic understanding of AI/NLP concepts
- Exposure to medallion architecture or lakehouse best practices.
- Experience with orchestration frameworks (ADF, Workflows, Airflow, DBX, etc.).
- Experience with CI/CD tools and version control (Git, GitHub Actions or equivalent).
- Basic understanding of security practices: RBAC, encryption, credential management.
- Databricks certification (Data Engineer Associate or equivalent).
- 3 à 5 ans d'expérience en ingénierie de données, avec une solide expérience dans la construction et l'exploitation de pipelines de données en production.
- Connaissance de la modélisation de données, de la qualité des données et de l'évolution des schémas.
- Bonne compréhension des pratiques de fiabilité des pipelines de données : surveillance, alertes et gestion des défaillances dans un système fonctionnant en continu.
- Expérience pratique avec Databricks (ou un environnement équivalent basé sur Spark) : conception de schémas, Delta Lake, optimisation de la performance et orchestration de pipelines.
- Expérience avec au moins un fournisseur cloud majeur (Azure de préférence; AWS/GCP également un atout).
- Expérience dans l'intégration d'API externes à grande échelle : authentification, pagination, limites de taux, mécanismes de reprise, gestion des erreurs.
- Forte maîtrise de Python et SQL.
- À l'aise avec le traitement de données textuelles non structurées ou semi-structurées à grande échelle.
- Expérience en prompt engineering avec des LLM et/ou connaissances de base en IA/NLP.
- Connaissance de l'architecture medallion ou des meilleures pratiques lakehouse.
- Expérience avec des frameworks d'orchestration (ADF, Workflows, Airflow, DBX, etc.).
- Expérience avec des outils CI/CD et de contrôle de version (Git, GitHub Actions ou équivalent).
- Connaissances de base des pratiques de sécurité : RBAC, chiffrement, gestion des identifiants.
- Certification Databricks (Data Engineer Associate ou équivalent).
- Competitive Salary – A competitive compensation package based on experience and qualifications.
- Medical, Dental, and Vision Insurance – Comprehensive insurance coverage to support you and your family.
- 401(k) Plan with Company Match.
- Generous Paid Time Off (PTO) – Time off to support work-life balance and personal needs.
- Company-Paid Holidays – Paid holidays throughout the year.
- Flexible Work Options – Work-from-home opportunities are available, depending on role and business needs.
- On-Call Compensation – Additional pay for eligible on-call shifts.
- Salaire compétitif — Une rémunération concurrentielle basée sur l'expérience et les qualifications.
- Assurance médicale, dentaire et visuelle — Une couverture d'assurance complète pour vous et votre famille.
- Régime de retraite avec contribution de l'employeur .
- Congés payés généreux — Du temps libre pour favoriser l'équilibre travail-vie personnelle.
- Jours fériés payés par l'entreprise — Congés payés tout au long de l'année.
- Modalités de travail flexibles — Possibilité de télétravail selon le poste et les besoins de l'entreprise.
- Compensation pour disponibilité — Rémunération additionnelle pour les quarts de garde admissibles.
Vacancy posted more than 2 months ago
Do you want to receive more vacancies?
Subscribe and receive similar vacancies to Data Engineer RD-017. Be the first to apply!
