Crédit d'impôt recherche et machine learning

En machine learning appliqué, la difficulté vient rarement de l'algorithme. Les bibliothèques sont matures, les recettes sont publiées, et un modèle de gradient boosting entraîné sur des données correctement préparées relève de l'ingénierie, pas de la recherche.

Ce qui reste incertain, c'est le signal : savoir s'il existe dans les données dont vous disposez, et si l'on peut le rendre exploitable. C'est là que se situe l'essentiel des travaux valorisables, et c'est aussi la partie que les dossiers décrivent le moins bien.

La raison en est presque culturelle : les équipes racontent volontiers le modèle retenu et beaucoup moins le chemin parcouru pour y arriver. Or c'est ce chemin — les représentations testées, les protocoles corrigés, les pistes abandonnées — qui constitue la démonstration.

Éligibilité

Êtes-vous éligible ?

Sur cette technologie, l'éligibilité se démontre par la mesure plutôt que par le récit.

  • Le signal utile n'est pas directement observable dans les données, et sa construction constitue l'essentiel de la difficulté rencontrée
  • Les méthodes standard échouent de façon reproductible sur votre distribution de données, et cet échec est documenté par des mesures comparées à une baseline
  • Le protocole de validation a dû être conçu parce que les découpages classiques produisaient des résultats trompeurs — fuite de données, dérive temporelle, dépendance entre observations
  • Le déséquilibre de classes, la rareté des étiquettes ou le bruit d'annotation posent un problème méthodologique en eux-mêmes, et pas seulement un problème de volume
  • La comparaison à une approche simple existe et montre l'apport technique réel des travaux menés
  • L'entreprise est imposée d'après son bénéfice réel et les travaux sont menés dans l'Espace économique européen

Ce qui est habituellement écarté

  • Application d'une bibliothèque de gradient boosting sur un jeu de données propre avec une recherche d'hyperparamètres standard
  • Travaux de reporting ou de business intelligence présentés comme de la modélisation prédictive
  • Absence de comparaison à une baseline simple, qui empêche de démontrer l'apport technique

Assiette

Ce qui est finançable

Les postes retenus reflètent la réalité d'une équipe qui travaille sur la donnée avant de travailler sur le modèle.

Travaux de construction de représentations

Le temps passé à concevoir et tester des transformations qui rendent un signal exploitable est le cœur du sujet en machine learning appliqué. Il se valorise au prorata du temps réellement consacré à ces travaux, séparément du développement applicatif qui les entoure.

Conception des protocoles de validation

Quand les découpages standard produisent des scores trompeurs, concevoir un protocole qui reflète l'usage réel devient un travail de recherche. C'est souvent la partie la plus convaincante d'un dossier, parce qu'elle démontre que l'incertitude était mesurable.

Traitement de la rareté et du déséquilibre des étiquettes

Développer des méthodes qui tiennent avec peu d'exemples annotés, ou avec des classes très déséquilibrées, dépasse l'application d'une option de bibliothèque. Les campagnes comparatives menées pour trancher entre approches entrent dans l'assiette.

Détection et traitement de la dérive en production

Caractériser la façon dont les performances se dégradent dans le temps, puis concevoir les mécanismes de réentraînement associés, relève des travaux quand la littérature ne fournit pas de réponse applicable à votre régime de données.

Amortissements des moyens de calcul

Les machines acquises neuves et affectées aux travaux ouvrent droit à leurs dotations aux amortissements, majorées du forfait de fonctionnement. Le partage entre usage de recherche et usage de production doit être documenté.

Sous-traitance auprès d'un organisme agréé

Les travaux confiés à un laboratoire public ou à un prestataire titulaire de l'agrément entrent dans l'assiette. En machine learning, cela concerne fréquemment les collaborations avec des équipes académiques sur les aspects méthodologiques.

Point d'attention

Ce qui change pour le machine learning

  • En machine learning, la comparaison à une baseline simple est ce qui permet de démontrer l'apport technique. Un dossier qui présente un score sans point de comparaison ne démontre rien : il décrit un résultat, pas une incertitude levée.
  • Les subventions publiques perçues sur les mêmes travaux viennent en déduction de l'assiette. C'est un point sensible pour les équipes machine learning, souvent financées en parallèle par des dispositifs de recherche collaborative.

Estimer le montant mobilisable

L'assiette dépend de la part du temps de vos data scientists consacrée aux travaux comportant une incertitude, et non de l'ensemble de leur activité. Le calculateur donne une fourchette indicative à partir de votre masse salariale ; le prorata réel se tranche projet par projet, avec un expert.

FAQ

Questions fréquentes

Entraîner un modèle sur nos données internes suffit-il ?

Non, si l'opération suit une procédure documentée et que le résultat était prévisible. Le sujet devient éligible quand la nature de vos données met les approches standard en échec de manière reproductible, et que vous avez dû concevoir autre chose.

Comment séparer la R&D du travail de data engineering ?

Par la finalité. Construire un pipeline d'ingestion fiable est de l'ingénierie. Concevoir une représentation dont on ne sait pas si elle portera le signal recherché, et le vérifier expérimentalement, relève des travaux de recherche.

Les expérimentations qui n'ont rien donné sont-elles perdues ?

Elles sont au contraire utiles au dossier : une approche testée puis abandonnée documente l'incertitude qui existait au départ. Leur valorisation suppose qu'elles aient été tracées au moment des essais, avec leurs hypothèses et leurs résultats.

Faut-il un doctorant dans l'équipe ?

Aucune condition de diplôme ne conditionne l'éligibilité des travaux. Le régime de faveur qui majorait les dépenses liées aux jeunes docteurs a par ailleurs été supprimé par la loi de finances pour 2025.

Quelles traces conserver au quotidien ?

L'historique des expérimentations avec leurs métriques, les décisions techniques et leurs motifs, et un relevé de temps par projet. Un outil de suivi d'expériences couvre déjà l'essentiel de ce besoin sans effort supplémentaire.

Savoir ce qui tient avant de déclarer

Le diagnostic situe vos travaux au regard des critères publics et vous indique ce qu'il faut documenter dès maintenant. Vous repartez avec une checklist utilisable, que vous travailliez avec nous ou non.