Financer la R&D en Data engineering

Traitement de données à grande échelle, où l'éligibilité tient à un régime de charge que les moteurs existants ne traitent pas.

SparkFlinktraitement en fluxrésolution d'entitésconfidentialité différentiellemoteur de requêtes

La frontière

Ce qui distingue la recherche de l'intégration

Sur cette technologie, c'est ce tri qui détermine la part du travail réellement valorisable.

  • Le régime de charge — volume, latence, cardinalité, fraîcheur — met en défaut les moteurs standard, mesures à l'appui
  • Les garanties de confidentialité recherchées imposent des méthodes qui dégradent l'utilité des données, et ce compromis est étudié
  • Le travail produit un composant de traitement, pas un pipeline d'orchestration

Ce qui est habituellement écarté

  • Construction d'un entrepôt de données et de ses pipelines d'ingestion avec les outils du marché
  • Développement de tableaux de bord et de modèles sémantiques
  • Migration d'un système décisionnel vers une architecture moderne

Postes de dépenses

Ce qu'une équipe Data engineering engage réellement

  • Développement de moteurs ou d'opérateurs de traitement au-delà des capacités des frameworks utilisés
  • Conception de méthodes de résolution d'entités ou de réconciliation sur données hétérogènes
  • Travaux sur la confidentialité des données : anonymisation, confidentialité différentielle, calcul sur données chiffrées
  • Construction de bancs de mesure représentatifs du régime de charge visé