Data lineage : définition et usages
Le data lineage, ou lignage des données, décrit le chemin parcouru par une donnée depuis sa source jusqu'à son usage final : les systèmes traversés, les traitements qui l'ont transformée, les rapports et les modèles qui l'emploient. Il répond à deux questions : d'où vient ce chiffre, et que touchera cette modification. Il se représente sous forme de graphe, que l'on parcourt vers l'amont ou vers l'aval.
Lignage technique et lignage métier
Le lignage technique suit les données colonne par colonne, à travers les requêtes SQL, les traitements d'intégration et les modèles de restitution. Il se construit en grande partie automatiquement, en lisant le code des flux et les journaux d'exécution ; le standard ouvert OpenLineage normalise la collecte de ces événements entre outils. Le lignage métier en donne une lecture simplifiée : il relie un indicateur du reporting aux systèmes et aux règles de gestion qui le produisent.
Analyse d'impact et exigences réglementaires
Vers l'aval, le lignage sert l'analyse d'impact : avant de renommer une colonne, de changer une règle de calcul ou de retirer une table, l'équipe voit les tableaux de bord et les traitements concernés. Vers l'amont, il accélère le diagnostic d'un chiffre faux, en remontant la chaîne jusqu'à l'étape où l'écart apparaît. Il fournit aussi la preuve de provenance que demandent les auditeurs.
Dans la banque, les principes BCBS 239, publiés en janvier 2013 par le Comité de Bâle, demandent aux établissements d'importance systémique de maîtriser l'agrégation de leurs données de risque. Les superviseurs, dont la Banque centrale européenne, attendent un lignage documenté des données qui alimentent les rapports réglementaires.
Qui construit le lignage
Le data steward documente le lignage métier, vérifie sa cohérence avec les définitions du glossaire et répond aux questions des utilisateurs sur l'origine d'un indicateur. Le data engineer instrumente les flux pour que chaque exécution publie son lignage, et s'en sert pour mesurer l'effet d'une évolution avant de la déployer. L'analytics engineer tient le lignage de la couche de transformation, que des outils comme dbt génèrent à partir des dépendances déclarées entre modèles.
Les métiers
Les métiers qui s'en occupent.
- Gouvernance & Référentiels Data (MDM)Data Steward / MDM Manager
45 k€ à 120 k€ et plus brut annuel
- Data, BI & PlateformesData Engineer
42 k€ à 130 k€ et plus brut annuel
- Data, BI & PlateformesAnalytics Engineer
40 k€ à 110 k€ et plus brut annuel
Questions fréquentes
Data lineage : vos questions.
- Quelle différence entre data lineage et data provenance ?
- La provenance décrit l'origine d'une donnée et l'historique de ses états : qui l'a créée, quand, à partir de quelles sources, avec quelles modifications successives. Le lineage met l'accent sur le parcours et les dépendances entre systèmes, dans les deux sens. Les deux notions se recouvrent largement, et de nombreux outils emploient l'une pour l'autre. Le W3C a normalisé la description de la provenance avec son modèle PROV, publié en 2013.
- Comment mettre en place un data lineage ?
- Le projet part des usages prioritaires : un reporting réglementaire, les indicateurs du comité de direction, les données d'un modèle critique. L'équipe connecte un outil de lignage aux sources, aux traitements et aux outils de restitution de ce périmètre, vérifie le graphe obtenu avec les data stewards, puis complète à la main les maillons que la lecture automatique laisse de côté, comme un fichier retraité sur tableur. Le périmètre s'étend ensuite domaine par domaine.
- Quels outils de data lineage ?
- Les catalogues de données intègrent en général un module de lignage : Collibra, Alation, Atlan, DataGalaxy, Microsoft Purview ou Unity Catalog chez Databricks. Des éditeurs spécialisés, comme Solidatus ou Manta, racheté par IBM en 2023, se concentrent sur l'analyse fine des flux. Les outils de transformation comme dbt, et les orchestrateurs compatibles avec OpenLineage comme Apache Airflow, produisent eux-mêmes une partie du graphe à chaque exécution.
Dans le lexique : Data catalog, Qualité des données (data quality), Data governance (gouvernance des données).
À propos de l'auteur

Consultant Sourcing chez Entourage Recrutement
Sourceur depuis sept ans sur les métiers financiers et technologiques, Bruno approche les profils qui restent loin des annonces. Il intervient sur les mandats en CDI comme sur les missions freelance.
Vous recrutez sur ces sujets ?
Décrivez le poste et son périmètre. Un consultant Tech vous recontacte sous 24 heures ouvrées pour cadrer la recherche avec vous.
