---
title: Ian Rudd, PhD : des systèmes d’IA que vous pouvez défendre
url: https://drrudd.com/fr/
language: fr-CA
description: Je conçois les plateformes d’IA sur lesquelles fonctionnent les grandes organisations, et je dirige les équipes qui les bâtissent. Près de vingt ans à...
modified: 2026-08-09T15:31:02-04:00
---
# Ian Rudd, PhD

Architecte en chef de l’IA, Doctorat en apprentissage automatique et IA, 20 ans et plus d’expérience

Je conçois les plateformes d’IA sur lesquelles fonctionnent les grandes organisations, et je dirige les équipes qui les bâtissent.

Près de vingt ans à faire sortir l’intelligence artificielle du laboratoire pour la mettre en production, au fédéral, en banque, en assurance, dans le commerce de détail national et dans le transport. Je définis l’architecture, je dirige les équipes de science des données, d’architecture de données et d’ingénierie qui la réalisent, et je démontre que le résultat tient devant un vérificateur. La figure 1 montre la défaillance que l’on m’embauche pour empêcher : un système sûr de lui et dans l’erreur.

Architecte en chef de l’IA, Gouvernement · Banque · Assurance · Détail, Équipes, laboratoires et plateformes dirigés, Français et anglais

Entamer la conversation Voir ce que cela coûte

Cent décisions prises par un système d’IA, sans intervention humaine
- 67 réussies
- 19 ratées, en se disant peu sûre
- 14 ratées, en se disant sûre d’elle

Ce qu’elle annonce réussir

81 sur 100

Ce qu’elle réussit vraiment

67 sur 100

Figure 1. Chaque carré est une décision. Bleu, elle l’a réussie. Gris, elle l’a ratée en se disant peu sûre : quelqu’un pouvait intervenir. Rouge, elle l’a ratée en se disant sûre d’elle : rien n’a été signalé et personne n’a regardé. Une démonstration ne vous montrera jamais les rouges, car elle montre des réponses et jamais la certitude qui se cache derrière. Les trouver est la première chose que je fais. Un système simulé, pas celui d’un client : 2000 décisions générées dans votre navigateur, présentées en 100 carrés (amorce 7). mesuré

## En bref
- 20 Années en intelligence artificielle, du laboratoire de recherche à une plateforme gouvernementale nationale
- 6 Secteurs servis : gouvernement, banque, assurance, commerce de détail, transport et recherche technologique
- 1M+ Paiements par jour vérifiés contre la fraude par des systèmes que j’ai conçus
- PhD Informatique, avec des certifications en architecture, en sécurité et en gestion de projet
- 3 Brevets accordés, et des travaux publiés sur la fiabilité et la sûreté de l’IA
- 2 Langues officielles, français et anglais, servies au même niveau

Chaque figure de cette page est calculée dans votre navigateur pendant que vous la lisez, et vérifiée contre un calcul indépendant avant publication. Rien ici n’est une capture d’écran, et rien n’est repris d’un banc d’essai de fournisseur.

## Ce que l’excès de confiance vous coûte

La plupart des équipes placent un seuil de confiance devant leur IA : tout ce dont le modèle est assez sûr passe sans qu’un humain le regarde. Cette règle ne vaut jamais mieux que le score de confiance qui la porte, et ces scores sont habituellement gonflés. Entrez votre propre volume et le coût d’une erreur, et observez ce que la règle laisse réellement passer.

Approuver sans révision au-dessus de 90%

Décisions par mois

Coût d’une décision erronée

### Le modèle tel que livré

Passe sans révision

47.3%

Erronées, parmi celles-là

17.4%

Mauvaises décisions par an

9,870

Certitude non méritée

+14.2%

Exposition annuelle $2.47M

### Après calibration

Passe sans révision

8.1%

Erronées, parmi celles-là

3.1%

Mauvaises décisions par an

300

Certitude non méritée

-3.6%

Exposition annuelle $75.0K

Ce que cela montre. À ce seuil, le modèle tel que livré laisse passer 47.3% de vos cas et se trompe sur 17.4% d’entre eux, tout en annonçant au moins 90% de confiance sur chacun. La calibration ne rend pas le modèle plus intelligent et ne réordonne aucune réponse. Elle fait en sorte que le nombre veuille dire ce qu’il annonce. Le montant est le produit de vos deux nombres et du taux mesuré : 10,000 par mois × 12 mois × 47.3% qui franchissent le seuil × 17.4% d’erreurs × $250 chacune = $2.47M par an. dérivé

Notez l’arbitrage. La colonne corrigée automatise moins : 8.1% des cas au lieu de 47.3%. C’est la décision qui mérite d’être prise sciemment plutôt que par accident. Moins d’automatisation, en échange de décisions défendables ensuite.

Et là où cela ne s’applique pas Il s’agit d’un modèle synthétique, pas du vôtre. Les deux entrées sont les vôtres et tout le reste n’est que du dénombrement, mais les taux d’erreur proviennent d’un classifieur généré. À lire comme la forme du problème plutôt que comme un devis pour votre système. Le mesurer correctement sur vos données est un travail de deux semaines.

## Ce que je fais

Dix raisons pour lesquelles des organisations font appel à moi. Certaines relèvent de la stratégie et de l’architecture, d’autres de la modélisation concrète, d’autres encore de la direction de l’équipe qui doit garder le résultat en vie après mon départ. Chacune indique quand on m’appelle, ce que je fais concrètement, ce qui aboutit sur votre bureau à la fin, et la condition qui rend le domaine entier inutile à confier à qui que ce soit.

### Stratégie d’IA et architecture d’entreprise

Quand on m’appelle Vous avez des projets pilotes qui impressionnent en démonstration et rien qui survive à la sécurité, à l’approvisionnement, ou à une deuxième équipe qui tente de bâtir dessus.

Je fixe l’orientation et la forme : architectures de référence, normes, patrons de sécurité et zones d’atterrissage, portes de revue qu’une solution doit franchir avant la production, et la couche de service qui permet aux applications d’affaires d’atteindre un modèle par un contrat stable et sécurisé. Je fais l’arithmétique qui décide du matériel et de l’hébergement avant toute signature, pour que le coût d’exploitation soit un nombre et non une surprise. Puis je porte les options, le coût et le risque dans la salle où la décision de financement se prend réellement, dans la langue de cette salle.

Ce que vous obtenez Une architecture de référence avec les normes et les portes de revue qui l’accompagnent, une feuille de route pluriannuelle liée aux priorités d’affaires, et un modèle de coût et de capacité auquel votre fournisseur peut être tenu.

Inutile d’entreprendre si Personne ne prend en charge la plateforme après mon départ. Des normes sans responsable nommé deviennent de la documentation, et la documentation n’empêche pas le prochain projet pilote isolé.

### Des assistants qui répondent à partir de vos propres documents

Quand on m’appelle L’assistant répond à partir de vos politiques, contrats ou dossiers, et il a tort avec assurance assez souvent pour que plus personne ne s’y fie.

Je traite la recherche comme le système principal et non comme un prétraitement : la façon de découper les documents, les métadonnées qui accompagnent chaque fragment, la combinaison de la correspondance par mots-clés et par sens, le réordonnancement des résultats, et la mesure de la fréquence à laquelle la bonne source a seulement été trouvée. Là où les règles changent dans le temps, la réponse doit être celle en vigueur à la date visée, avec la clause citée pour qu’une personne la vérifie en quelques secondes au lieu de se fier à une paraphrase.

Ce que vous obtenez Un tableau de bord de la recherche qui sépare « jamais trouvé » de « trouvé puis mal répondu », la conception de découpage et de métadonnées qui le sous-tend, et les correctifs classés selon ce que chacun rapporte.

Inutile d’entreprendre si Personne n’annotera les documents pertinents. Sans cela, toute mesure de qualité est déduite de la réponse finale et l’étape de recherche demeure invisible.

### Des agents qui savent s’arrêter

Quand on m’appelle Vous voulez que le système agisse et non qu’il se contente de répondre, et personne ne peut vous dire ce qu’il fera le jour où il aura tort.

Un planificateur qui décompose une demande en tâches typées, des agents spécialisés en dessous, un contrat typé sur chaque outil que l’agent peut atteindre, des budgets d’étapes et de jetons, une détection de cycles, et une échelle de repli qui rétrécit la réponse puis la confie à une personne plutôt que d’inventer. Tout ce que l’agent extrait est traité comme une entrée non fiable : confinement des injections, listes d’outils autorisés, filtrage des sorties et contrôles d’exfiltration, maintenus dans la suite de régression au lieu d’être exécutés une seule fois au lancement.

Ce que vous obtenez Une conception d’agent dont les contrats d’outils, les budgets et le chemin d’escalade sont écrits, ainsi que la suite d’attaques simulées qui s’exécute à chaque changement plutôt que le jour du lancement.

Inutile d’entreprendre si La tâche n’a pas de transfert propre vers une personne. Un agent sans endroit sûr où échouer est un risque, quelle que soit son exactitude.

### Des modèles au-delà du dialogueur

Quand on m’appelle La décision qui vous coûte réellement de l’argent est une prévision, un score de risque ou un tri, et un modèle de langue n’en est pas la réponse.

L’essentiel de la valeur dans une grande organisation tient encore à de l’apprentissage automatique ordinaire bien fait. Prévision de la demande réconciliée entre article, site et réseau pour que les plans s’additionnent. Détection de fraude et évaluation du risque sous déséquilibre extrême des classes, mesurées à budget d’alertes fixe parce que la capacité des analystes est la contrainte réelle. Durée et retour au travail comme problème de survie, avec des risques concurrents tenus à part. Compréhension documentaire de correspondance hétérogène, avec révision humaine sur tout ce qui déclenche un paiement. Recommandation, classement, et les modèles séquentiels sous l’extraction.

Ce que vous obtenez Un modèle adapté à la décision qu’il alimente, une métrique choisie pour correspondre à ce que quelqu’un fait réellement du résultat, et un contrôle rétrospectif qui ne flatte pas celui qui a choisi la partition.

Inutile d’entreprendre si La décision alimentée ne se prend pas vraiment sur le nombre. Un modèle branché sur un processus que personne ne veut changer est un rapport coûteux.

### Une confiance sur laquelle agir

Quand on m’appelle Personne ne peut vous dire lesquelles des réponses du système sont sûres à utiliser sans qu’une personne les vérifie d’abord.

Je mesure si la confiance annoncée correspond à la réalité, je la corrige là où ce n’est pas le cas, et je place le seuil là où confier un dossier à une personne coûte moins cher que de se tromper. Quand une garantie ferme est nécessaire, la prédiction conforme attache un taux d’erreur démontrable au système sans supposer que le modèle soit bon.

Ce que vous obtenez Un rapport de calibration mesuré, une politique de seuil accompagnée de son arithmétique de coûts, et une règle d’acheminement que vos équipes d’exploitation peuvent réellement appliquer.

Inutile d’entreprendre si Le jeu de calibration cesse de ressembler à la production. Tout ici suppose que l’avenir ressemble à l’échantillon mesuré, et une dérive silencieuse des données invalide l’ensemble du dispositif sans déclencher d’alerte.

### Une évaluation que l’on peut échouer

Quand on m’appelle La démonstration fonctionne, les indicateurs sont bons, et le système continue de vous embarrasser devant de vrais utilisateurs.

Constituer les jeux d’évaluation à partir des échecs réellement observés plutôt que d’exemples commodes. Taxonomies d’erreurs, résultats ventilés par segment, cas difficiles tenus à part des cas représentatifs, notation par modèle vérifiée contre des évaluateurs humains au lieu d’être crue sur parole, tests de signification sur chaque amélioration annoncée, et toute la suite câblée dans la compilation pour qu’un changement de requête ne vous coûte pas discrètement du rappel.

Ce que vous obtenez Un jeu d’évaluation bâti sur vos échecs réels, avec un responsable nommé, et un format de rapport qui rend une régression impossible à manquer.

Inutile d’entreprendre si Personne n’accepte d’assumer l’annotation. L’évaluation est un problème de collecte de données déguisé en problème de métriques, et elle s’arrête dès que l’annotation n’a plus de responsable.

### Des données qui peuvent sortir

Quand on m’appelle Vous devez utiliser des données sensibles, ou publier quelque chose qui en dérive, et personne n’accepte de signer.

Décider ce qui franchit une frontière, et le démontrer. Détection des renseignements personnels et mesure de la fréquence des ratés du détecteur, caviardage irréversible, confidentialité différentielle pour les publications agrégées, comptabilité du budget sur toute une charge de requêtes, et évaluation du risque de réidentification. À côté de cela, la gouvernance qu’un examinateur réclame : tests de performance par sous-groupe, explications exploitables par un évaluateur, résidence des données, traçabilité, et contrôles de risque de modèle intégrés dès le premier schéma plutôt que la semaine avant le lancement.

Ce que vous obtenez Un modèle de menace écrit, un profil d’erreur de détection mesuré, un budget de confidentialité avec son registre, et les preuves d’équité et d’explicabilité qu’un examinateur réclamera.

Inutile d’entreprendre si Le modèle de menace n’est pas énoncé. Taux de détection, niveaux de bruit et budgets n’ont aucun sens tant que personne n’a écrit qui est l’adversaire et ce qu’il sait déjà.

### Du projet pilote à la production, et y rester

Quand on m’appelle Le modèle fonctionne sur le portable de quelqu’un, et chaque livraison depuis dépend de la disponibilité de cette personne.

Registres de modèles et de requêtes, données versionnées, portes d’évaluation automatisées qu’une livraison doit franchir avant d’être promue, chaînes de déploiement entre développement, test et production, et un chemin de retour arrière qui ne dépend pas de la présence de quelqu’un. Puis la surveillance qui dit que cela fonctionne toujours : qualité des réponses, qualité de la recherche, dérive des entrées, latence, taux d’échec et coût par interaction, rapportés en nombres plutôt qu’en opinions.

Ce que vous obtenez Un chemin de déploiement reproductible et vérifiable, la surveillance qui s’y greffe, et un guide d’intervention pour le jour où un modèle se met à dériver.

Inutile d’entreprendre si L’organisation ne sait pas encore déployer un logiciel ordinaire de façon fiable. Une exploitation d’apprentissage automatique bâtie sur une exploitation logicielle défaillante hérite de tous ses problèmes et en ajoute plusieurs.

### Des plateformes de données qui portent vos modèles

Quand on m’appelle Chaque projet de modèle commence par six semaines à chercher, nettoyer et débattre des données, et le débat ne se règle jamais deux fois de la même façon.

Avant le modèle, il faut une plateforme. Conception du lac et de l’entrepôt, chaînes en continu et par lots, magasins d’attributs, bases vectorielles, et l’intégration multinuage et événementielle sous tout cela. Puis la partie que la plupart des programmes sautent : qui possède quel jeu de données, ce qu’un consommateur a le droit de présumer à son sujet, d’où il vient, et ce qui arrive le jour où il change. J’ai dirigé des équipes d’architecture de données exactement là-dessus, et ramené de plusieurs jours à quelques heures le passage de l’événement brut au jeu d’entraînement utilisable, ce qui est la condition même de rafraîchissements fréquents des modèles.

Ce que vous obtenez Une architecture de données cible avec contrats de données, traçabilité et responsabilités nommées par domaine, et des chaînes sur lesquelles une deuxième équipe peut bâtir sans vous demander la permission.

Inutile d’entreprendre si L’organisation refuse de trancher qui possède un jeu de données. Tout correctif technique en aval de cette question est temporaire, et vous y reviendrez avant un an.

### Équipes, pratiques et laboratoires

Quand on m’appelle Vous avez des gens qui font de l’intelligence artificielle sans pratique autour d’eux, ou il vous faut quelqu’un pour diriger le groupe pendant qu’on le bâtit.

J’ai bâti des pratiques d’apprentissage automatique, de données et d’architecture à partir de rien dans de grandes organisations, dirigé des équipes de science des données, des équipes d’architecture de données et des équipes d’ingénierie, et animé un laboratoire de recherche d’entreprise où les résultats devaient être publiables et devaient aussi être livrés. Concrètement, cela veut dire le modèle opérationnel, le chemin d’admission et de priorisation, les instances de décision, le recrutement et l’encadrement, et les séances d’habilitation qui laissent un client capable de tout faire fonctionner sans moi. Cela veut dire aussi refuser tôt les propositions qui n’allaient jamais aboutir, devant les personnes qui les ont faites.

Ce que vous obtenez Un modèle opérationnel qui fonctionne avec des responsables nommés, un carnet de travaux priorisés et réellement livrables, et une équipe qui n’a plus besoin de moi dans la salle.

Inutile d’entreprendre si La direction veut la capacité sans l’autorité de changer la façon dont les décisions se prennent. Une pratique qui ne peut pas refuser une mauvaise demande est une file d’attente, pas une capacité.

## Là où j’ai livré

Décrit par rôle, par secteur et par contrainte plutôt que par employeur. Ce qui compte pour juger si je peux vous être utile, c’est la forme du problème, le siège que j’occupais pour le résoudre, et les règles sous lesquelles tout cela devait fonctionner.

### Gouvernement et secteur public

2020 à aujourd’hui

Rôle Architecte en chef de l’IA, et auparavant architecte principal de l’apprentissage automatique d’entreprise

Ministériel, bilingue

Ce que j’ai bâti et dirigé Définition de l’orientation d’IA d’entreprise d’un ministère : architectures de référence, patrons de sécurité, zones d’atterrissage et portes de revue qu’une solution doit franchir avant d’approcher la production. Construction de la plateforme sur laquelle travaillent les équipes de livraison, des assistants qui répondent à partir des fonds documentaires du ministère, et de l’orchestration multiagent derrière les parcours les plus difficiles. Mise sur pied de la pratique d’apprentissage automatique et d’architecture elle-même, des façons de faire jusqu’aux responsabilités, avec conseil aux niveaux directeur général et sous-ministre adjoint sur les coûts, les risques et les arbitrages.

Ce qui rendait cela difficile Renseignements protégés, service égal dans les deux langues officielles, documentation de niveau approvisionnement, et une piste de vérification complète derrière chaque réponse donnée.

### Assurance

2022 à 2025

Rôle Consultant principal, stratégie IA et données

Dossiers, documents médicaux et financiers

Ce que j’ai bâti et dirigé Mise en place du socle d’architecture et de gouvernance de l’IA, puis direction de la modélisation du risque lié aux réclamations : durée et retour au travail traités comme un problème de survie, calibrés pour qu’un décideur puisse agir sur le nombre, avec des risques concurrents gérés explicitement plutôt que réduits à une seule étiquette. S’y ajoutent la compréhension documentaire de la correspondance médicale et financière, des assistants ancrés dans les politiques, et la couche d’équité et d’explicabilité que le régulateur allait forcément réclamer.

Ce qui rendait cela difficile Sensibilité des dossiers de santé et financiers, des décisions automatisées qui déterminent si une personne est indemnisée, et chacune de ces décisions susceptible d’appel.

### Transport et logistique

2019 à 2022

Rôle Consultant, apprentissage automatique et architecture de données

Réseau national

Ce que j’ai bâti et dirigé Établissement de la pratique d’architecture d’entreprise et d’apprentissage automatique, construction de la plateforme sous-jacente, et définition de l’approche de prévision : volumes réconciliés aux niveaux article, installation et réseau pour que les plans s’additionnent réellement, demande éparse traitée pour ce qu’elle est, et délais de livraison présentés comme une fenêtre que le client vit plutôt qu’une moyenne que personne ne vit.

Ce qui rendait cela difficile Demande éparse et saisonnière, un réseau où des prévisions individuellement plausibles peuvent rester collectivement fausses, et une exploitation qui planifie chaque jour à partir de ces prévisions.

### Banque et services financiers

2015 à 2019

Rôle Directeur-conseil, livraison de l’apprentissage automatique

~1M d’événements par jour

Ce que j’ai bâti et dirigé Définition de la posture de modélisation pour la fraude et le risque sur des flux de transactions à environ un million d’événements par jour : apprentissage sensible au coût sous déséquilibre extrême des classes, précision mesurée à budget d’alertes fixe parce que la capacité des analystes est la vraie contrainte, et attributs de graphe pour repérer les réseaux qui paraissent innocents un compte à la fois. Construction du modèle d’exploitation suivi par les équipes, et défense des positions d’architecture et de risque de modèle devant les instances du dirigeant principal de l’information et du dirigeant principal des risques.

Ce qui rendait cela difficile Gouvernance prudentielle des modèles : chaque changement est un événement vérifiable avec un responsable nommé, face à des adversaires qui s’adaptent dès qu’on cesse de regarder.

### Commerce de détail et biens de consommation

2010 à 2015

Rôle Directeur principal, plateformes d’apprentissage automatique et de données d’entreprise

Article, magasin et centre de distribution

Ce que j’ai bâti et dirigé Direction de la modernisation d’architecture qui a élargi la capacité d’apprentissage automatique de l’organisation : stratégie multinuage, intégration événementielle, et chaînes d’attributs qui ont ramené de plusieurs jours à quelques heures le passage de l’événement brut au jeu d’entraînement utilisable. Définition de l’architecture de prévision de la demande, réconciliée entre article, magasin et centre de distribution, avec les effets promotionnels et la cannibalisation modélisés plutôt que supposés, et construction des fondations de recommandation sous le marchandisage.

Ce qui rendait cela difficile Saisonnalité, régimes de fêtes qui se comportent comme un problème distinct, et un horizon de prévision plus court que la chaîne logistique qu’il pilotait.

### Recherche technologique

2007 à 2010

Rôle Architecte et chef d’équipe, recherche et ingénierie en IA

De la recherche au produit

Ce que j’ai bâti et dirigé Direction de l’équipe de recherche et d’ingénierie derrière un système de question-réponse : décomposition de la question, extraction de passages, pondération des preuves et classement des réponses, distribués en parallèle puis fusionnés, avec un chemin défini pour les cas où la confiance revenait trop basse pour répondre. C’est la même forme que le problème d’orchestration d’agents que le domaine redécouvre aujourd’hui, environ dix ans avant qu’il ait un nom. Définition du programme de recherche, encadrement d’ingénieurs et de stagiaires des cycles supérieurs, et livraison à des clients.

Ce qui rendait cela difficile Transfert de la recherche au produit : des résultats publiables qui devaient aussi être livrés, chaque amélioration annoncée étant soumise à un test de signification qui en éliminait environ la moitié.

## Ce que je vous dirai et qu’un fournisseur taira

Huit affirmations que je défendrai en réunion, de la question du conseil d’administration à celle de l’ingénieur. Chacune est accompagnée de la condition qui l’annule, énoncée clairement, en rouge. Un fournisseur ne vous donnera pas cela, et c’est toute la différence.

### La plupart des programmes d’IA échouent sur l’exploitation, pas sur le modèle.

Ce que cela vous coûte Le budget va à la partie qui n’a jamais été le goulot d’étranglement, et le programme s’enlise au bout d’un an sans rien en production.

La modélisation est habituellement la portion la plus courte du travail. Ce qui tue les programmes, c’est tout ce qui l’entoure : personne ne possède les données, aucun chemin reproductible ne mène du portable à la production, il n’y a ni surveillance, ni retour arrière, ni réponse pour le vérificateur, ni personne nommément responsable quand la qualité dérive. Financez cela d’abord et la modélisation paraît facile. Financez la modélisation d’abord et vous obtenez une démonstration.

Et là où cela ne s’applique pas Faux à la frontière de la recherche. Si vous tentez véritablement ce que personne n’a fait, le risque scientifique est réel et domine tout le reste. Très peu de programmes d’entreprise sont dans cette position, et la plupart de ceux qui le croient ne l’ont pas vérifié.

### Acheter une plateforme ne vous achète pas une capacité.

Ce que cela vous coûte Vous payez la licence et il vous faut quand même l’équipe : l’analyse de rentabilité qui a justifié l’achat était fausse du coût de cette équipe.

L’outillage retire les parties qui étaient déjà faciles. Il ne décide pas quoi construire, il n’écrira pas votre jeu d’évaluation, il n’annotera pas vos documents, et il ne dira pas à votre direction quel arbitrage accepter. Toutes les plateformes que j’ai vues produire de la valeur avaient autour d’elles des gens capables d’en bâtir une version moins bonne eux-mêmes. Celles qui ont échoué avaient acheté l’outil au lieu des gens.

Et là où cela ne s’applique pas Pour une charge étroite, standard, à faible risque et sans données particulières, acheter est vraiment la bonne réponse et construire relève de la vanité. Le test est de savoir si vos données et vos règles sont ordinaires. Elles ne le sont généralement pas, et c’est pourquoi vous lisez ceci.

### Le score de confiance de votre IA est un nombre qu’elle a inventé.

Ce que cela vous coûte Toute règle du type « approuver automatiquement au-dessus de 90 % » est, aujourd’hui, une règle appliquée à du bruit.

Rien dans l’entraînement usuel n’oblige la confiance annoncée par un modèle à correspondre à la fréquence à laquelle il a effectivement raison. L’entraînement récompense le fait de placer la bonne réponse en tête, pas l’honnêteté sur son degré de certitude. Le nombre ressemble donc à une probabilité, se comporte comme un classement, et finit utilisé comme une garantie. Mesurez-le avant d’y accrocher de vraies décisions.

Et là où cela ne s’applique pas La calibration est une moyenne sur une population. Un modèle qui paraît sage dans l’ensemble peut être gravement fautif sur le seul sous-groupe qui vous importe, et un indicateur unique masquera précisément cela.

### Quand l’IA répond mal à partir de vos documents, c’est la recherche qui a échoué, pas l’IA.

Ce que cela vous coûte Des équipes passent des mois à régler le modèle alors que le correctif était une étape en amont, et peu coûteux.

Si le bon passage n’a jamais été extrait, aucune ingénierie de requête ne le récupérera. Mesurez la fréquence à laquelle la bonne source est retrouvée, séparément de la qualité de la réponse finale. Ce sont deux défauts distincts, avec des correctifs distincts, et l’un se fait passer pour l’autre pendant des mois.

Et là où cela ne s’applique pas Cette séparation n’est possible que si quelqu’un annote les documents réellement pertinents. Sans ces annotations, la qualité de la recherche est déduite de la réponse finale, soit exactement la confusion que l’on voulait écarter.

### Une évaluation que l’on ne peut pas échouer est du marketing, pas une preuve.

Ce que cela vous coûte Un score qui monte sur un jeu de test figé est le faux réconfort le plus coûteux du domaine.

Un jeu de test constitué de cas que le système traite déjà mesure l’accord avec hier. Construisez-le à partir des échecs réellement observés, gardez ceux qui font mal, et rapportez les cas difficiles séparément des cas représentatifs. Rapportez aussi la queue lente : le temps de réponse moyen n’est l’expérience de personne, et c’est le pire cas sur cent que vos utilisateurs retiennent.

Et là où cela ne s’applique pas Un jeu construit de façon adverse s’éloigne du réel. Il en faut un représentatif et un difficile, rapportés séparément, car les moyenner produit un nombre qui ne décrit ni l’un ni l’autre. Et un pire-cas-sur-cent mesuré sur deux cents requêtes est une anecdote avec une décimale.

### La personne rare dans une équipe d’IA n’est pas le modélisateur.

Ce que cela vous coûte Vous embauchez trois spécialistes des données et, dix-huit mois plus tard, le travail est encore coincé entre un carnet de notes et un système de production.

Construire un modèle est devenu la partie banalisée de ce métier. Les personnes rares sont celles qui font franchir la frontière à un système : l’ingénieur qui rend le service fiable et observable, la personne qui prendra en charge le jeu d’évaluation annoté et continuera de le faire après la fête de lancement, et l’architecte capable de tenir une position dans une revue de sécurité. Une équipe composée uniquement de modélisateurs produit d’excellents modèles que personne ne déploie.

Et là où cela ne s’applique pas Si vous n’avez aucune capacité de modélisation, commencez évidemment par là. Cette affirmation porte sur la deuxième, la troisième et la dixième embauche, et sur ce à quoi ressemble une équipe qui fonctionne, pas sur le point de départ.

### Faire tourner le modèle est un problème de mémoire, pas de puissance de calcul.

Ce que cela vous coûte C’est pourquoi votre devis de matériel est faux, et pourquoi il peut l’être dans les deux sens.

Chaque mot produit par le modèle exige de relire l’ensemble du modèle depuis la mémoire. C’est pourquoi compresser le modèle achète plus de vitesse que des puces plus rapides, et pourquoi servir plus d’utilisateurs à la fois élève le débit total tout en faisant attendre chacun plus longtemps. La décision matérielle découle d’une arithmétique faisable avant toute signature.

Et là où cela ne s’applique pas Vrai seulement tant que la bande passante mémoire est le facteur limitant. De grands lots, des entrées courtes ou des charges dominées par le document vous font passer de l’autre côté de la ligne, et chacune de ces intuitions s’inverse.

### Un budget de confidentialité se dépense, il ne se détient pas.

Ce que cela vous coûte La plupart des équipes le dimensionnent pour une publication, puis répondent à mille questions sur les mêmes données.

Chaque requête sur un jeu de données protégé consomme une part de votre garantie et ne la rend pas. Après assez de questions, la garantie a disparu, même si chaque requête paraissait parfaitement sûre sur le moment. Quelqu’un doit tenir le registre, et il ne figure presque jamais sur le schéma d’architecture.

Et là où cela ne s’applique pas La comptabilité standard est un pire cas. Une méthode plus fine récupère une marge réelle, mais seulement si le mécanisme s’y prête, ce qui relève de la modélisation et non d’un paramètre de configuration.

## Ce que je peux vous montrer

Quatre instruments fonctionnels, pas des captures d’écran. Chacun calcule dans votre navigateur à mesure que vous déplacez les commandes : vous pouvez vérifier l’affirmation au lieu de la croire. Lisez la phrase en clair sur chacun ; la mécanique en dessous est là pour la personne à qui vous transmettrez ce lien.

Chaque figure est vérifiée contre un calcul indépendant avant publication : forme close, exemple calculé à la main, ou limite analytique connue. Une figure non reproductible ne paraît pas sur la page.

Figure 2 Donner un sens à un score de confiance

On peut rendre un modèle honnête sur sa propre certitude en ajustant un seul nombre, sans changer aucune de ses réponses. Le panneau de droite va plus loin : il attache un taux d’erreur garanti à un système même lorsqu’on n’a aucune raison de faire confiance au modèle.

La mécanique, pour la ou le spécialiste

Excès de confiance ×1.90

Température T = 1.00

Non-couverture α = 0.10

Amorce

ECE

0.1465

Écart max

0.225

Exactitude

66.6%

Confiance moyenne

81.3%

Ajustée

T = 2.45

À gauche : l’exactitude observée par classe de confiance, comparée à la diagonale qu’un modèle calibré suivrait. Les barres sous la ligne sont les classes où le modèle a promis plus qu’il n’a livré. La mise à l’échelle par température divise les logits par une constante, ce qui déplace la confiance sans déplacer une seule décision. À T = 1, il s’agit du modèle non corrigé. Utilisez Ajuster T pour voir ce qu’une seule constante récupère. À droite : la prédiction conforme par partition prend un seuil sur une moitié de calibration et l’applique à une moitié réservée, sans supposer que le modèle soit bon. Couverture mesurée 91.7% pour une cible nominale de 90%, à q̂ = 0.978. La garantie est marginale et suppose l’échangeabilité. Ni l’une ni l’autre ne survit à une dérive de distribution, et rien dans la chaîne ne signale son arrivée. n = 2000 · seed = 7 · bins = 10 · partition 50/50 calibration/test mesuré

Figure 3 Ce que cela coûtera à exploiter, avant tout achat

Avant d’approuver du matériel ou de signer un contrat d’hébergement, cette arithmétique vous dit si le modèle voulu entrera seulement en mémoire, et à quelle vitesse il tournera. C’est l’heure de vérification diligente la moins chère qui existe, et c’est celle qu’on saute le plus souvent.

La mécanique, pour la ou le spécialiste

Modèle

Matériel

Poids

Contexte 8,192 tok

Lot 8

Poids

130.4 GB

Cache clé-valeur

20.0 GB 13%

Résident

150.4 GB / 80 GB

Limité par

mémoire

Débit global

166 tok/s

Par séquence

20.7 tok/s

Préremplissage

9.28 s

Cache = poids à

53,406 tok

À gauche : les poids sont constants ; le cache croît linéairement avec le contexte et avec la taille de lot. La bande ombrée est le cache, et là où elle franchit la ligne de capacité, la configuration cesse d’être déployable. À droite : la ligne de crête. Le décodage se situe très à gauche du point d’équilibre, d’où un débit gouverné par les octets déplacés plutôt que par le calcul. Cette configuration exige 150.4 GB pour 80 GB de mémoire disponible : elle ne s’exécute pas. Approximation pour transformeur dense. Elle ignore la mémoire d’activation, la fragmentation, l’attention paginée et le décodage spéculatif, qui déplacent tous le chiffre réel. À lire comme un plancher, pas comme une prévision. 2·P·b = 1.1T FLOP/step · 150.4 GB/step · 6.94 FLOP/byte vs balance 295 dérivé

Figure 4 Deux façons de chercher dans vos documents, côte à côte

Une méthode rate ce qu’elle aurait dû trouver. L’autre renvoie avec assurance des documents incapables de répondre à la question, signalés ici en rouge. Ni l’une ni l’autre n’est sûre seule, et « nous utilisons la recherche par IA » ne vous dit pas laquelle vous avez achetée.

La mécanique, pour la ou le spécialiste

Votre requête

Sondes

Lexicale (BM25) hors sujet

| # | id | topic | score |
| --- | --- | --- | --- |
| 1 | p7 | confidentialité | 3.016 |
| 2 | s4 | systèmes | 2.374 |
| 3 | c1 | incertitude | 2.272 |
| 4 | p6 | confidentialité | 2.198 |
| 5 | c4 | incertitude | 2.065 |

Premier résultat · p7 An audit trail has to record what was retrieved and why, not merely what was answered.

Latente (LSA) bon sujet

| # | id | topic | score |
| --- | --- | --- | --- |
| 1 | c4 | incertitude | 0.735 |
| 2 | c5 | incertitude | 0.712 |
| 3 | p7 | confidentialité | 0.651 |
| 4 | p1 | confidentialité | 0.512 |
| 5 | p6 | confidentialité | 0.467 |

Premier résultat · c4 Conformal prediction returns a set rather than a label, with a coverage guarantee that holds without assuming the model is any good.

Les deux classements, même corpus. La requête ne partage aucun mot de contenu avec sa réponse. La correspondance de surface n’a aucune prise et se trompe de sujet ; l’espace latent fait le pont. C’est à cela que sert la recherche dense. 32 documents · 290 termes · SVD tronquée de rang 8 conservant 31.5% de la norme de Frobenius au carré · BM25 (k₁=1,2, b=0,75) a apparié 5 documents La LSA n’est pas un modèle de plongement de phrases, et un simple découpage de suffixes n’est pas un vrai racineur. Ces deux choix désavantagent la méthode lexicale par rapport à un index de production réglé. C’est le motif de divergence qui compte, pas les scores absolus. mesuré

Figure 5 Ce qu’une garantie de confidentialité achète réellement

La protection de la vie privée fonctionne comme un budget, et chaque question posée aux données en dépense une part. Voici ce que vous pouvez encore apprendre à un niveau de protection donné, et le point où les réponses cessent de soutenir la moindre conclusion.

La mécanique, pour la ou le spécialiste

Perte de confidentialité ε = 0.100

Requêtes k = 100

Mécanisme

Publication

Échelle du bruit

10.00

EAM mesurée

10.079

Forme close

10.000

Erreur 95e centile

30.76

Erreur relative

6.51%

Budget dépensé

5.85

À gauche : une publication comparée à l’histogramme réel. Appuyez sur Retirer : les comptes réels sont fixes, les comptes publiés ne le sont pas, et c’est tout le mécanisme. Erreur absolue moyenne mesurée 10.079 contre la forme close 10.000, sur 1000 publications. À ce budget, l’erreur au 95e centile est de ±30.8, pour une plus petite classe réelle de 24, et la publication ne permet plus de conclure sur cette classe. À droite : répondre à 100 requêtes coûte 10.0 en composition de base, ou 5.9 selon la borne avancée. Une sensibilité de 1 suppose qu’un enregistrement déplace une classe d’une unité. La confidentialité de groupe, les contributions non bornées ou une jointure en amont rompent cette hypothèse, et le bruit calibré ici serait alors insuffisant. mesuré

## Les questions qu’on me pose

Ce que les gens veulent vraiment savoir avant de me contacter, répondu directement. Tout ce qui suit est également affirmé ailleurs sur cette page.

### Qui est Ian Rudd ?

Ian Rudd est architecte en chef de l’IA d’entreprise, établi au Canada. Titulaire d’un doctorat en apprentissage automatique et en intelligence artificielle, il compte près de vingt ans passés à faire sortir l’intelligence artificielle du laboratoire de recherche pour la mettre en production. Il définit l’architecture des plateformes d’IA d’entreprise et dirige les équipes de science des données, d’architecture de données et d’ingénierie qui la réalisent. Il a livré dans six secteurs : le gouvernement fédéral du Canada, l’assurance du secteur public, le transport et la logistique, les services bancaires et financiers, le commerce de détail, ainsi que la recherche en IA en entreprise chez IBM et Microsoft. Il détient trois brevets, a publié des travaux de recherche et donné des séminaires sur l’apprentissage profond et la sûreté de l’IA, et travaille dans les deux langues officielles du Canada.

### Que fait concrètement un architecte en chef de l’IA ?

Trois métiers à la fois. D’abord l’architecture : décider ce qui sera bâti, établir les modèles de référence, les patrons de sécurité et les zones d’atterrissage, et consigner les portes de revue qu’une solution doit franchir avant d’approcher la production. Ensuite la direction : bâtir et diriger les équipes de science des données, d’architecture de données et d’ingénierie, ainsi que la pratique qui les entoure, y compris qui est responsable de quoi quand une chose casse. Enfin celle que les descriptions de poste oublient : répondre du résultat devant un dirigeant, un organisme de réglementation ou un vérificateur, des mois après la mise en service. La plupart des programmes d’IA échouent sur les deux derniers points, pas sur le modèle.

### Pour quoi les organisations font-elles appel à Ian Rudd ?

Généralement pour l’une de quatre choses. Définir la stratégie d’IA et de données d’entreprise, et l’architecture qui la soutient. Diriger une équipe de science des données, d’architecture de données ou de recherche, ou bâtir cette pratique à partir de rien. La gouvernance des modèles, la conception de l’incertitude et de l’évaluation, afin que les décisions automatisées puissent être défendues après coup et pas seulement démontrées d’avance. Ou un second avis sur un système qui doit être juste, généralement lorsqu’un projet pilote a impressionné en démonstration et que personne ne peut dire s’il survit au contact de la sécurité, de l’approvisionnement ou d’une deuxième équipe. Si vous ne savez pas exactement lequel de ces besoins est le vôtre, décrire le symptôme suffit généralement à trancher.

### Dans quels secteurs Ian Rudd a-t-il travaillé ?

Six : le gouvernement fédéral du Canada, l’assurance du secteur public, le transport et la logistique, les services bancaires et financiers, le commerce de détail, et la recherche en IA et en apprentissage automatique chez IBM et Microsoft. Des systèmes qu’il a conçus vérifient plus d’un million de paiements et de réclamations par jour contre la fraude. Les régimes de contrainte diffèrent davantage que la technologie. Au gouvernement, cela veut dire de l’information protégée, un service dans les deux langues officielles et une piste de vérification derrière chaque réponse. En assurance, des décisions automatisées qui déterminent si une personne est payée, chacune susceptible d’appel. En transport, des prévisions sur lesquelles un réseau national planifie tous les jours.

### Ian Rudd travaille-t-il en français comme en anglais ?

Oui, dans les deux langues officielles, au même niveau d’exigence plutôt qu’une version traduite après coup. Cela compte pour le travail au gouvernement du Canada, où l’égalité de service en français et en anglais est une obligation légale et non une politesse, et pour toute organisation présente au Québec comme dans le reste du Canada. Ce site est publié intégralement dans les deux langues, et la version française est un document réel à sa propre adresse plutôt qu’une traduction automatique de l’autre.

### Qu’est-ce qui rend un système d’IA défendable ?

Le fait que quelqu’un puisse reconstituer, des mois plus tard, pourquoi le système a fait ce qu’il a fait, et démontrer que le raisonnement tenait à ce moment-là. En pratique, cela demande quatre choses : une confiance annoncée qui correspond à la fréquence réelle des bonnes réponses, une évaluation que le système est véritablement capable d’échouer, une piste de vérification complète derrière chaque réponse donnée, et une personne nommément responsable quand la qualité dérive. Un système auquel les quatre manquent peut tout de même fonctionner. Il ne peut simplement pas être défendu lorsqu’on pose la question, et dans un cadre réglementé, quelqu’un finit toujours par la poser.

### Pourquoi les scores de confiance d’une IA doivent-ils être calibrés ?

Parce que rien dans un entraînement ordinaire n’oblige la confiance annoncée par un modèle à correspondre à la fréquence réelle de ses bonnes réponses. L’entraînement récompense le fait de placer la bonne réponse en tête, pas celui d’être honnête sur sa propre certitude. Le nombre ressemble donc à une probabilité, se comporte comme un classement, puis se retrouve utilisé comme une garantie. Toute règle du type « approuver automatiquement au-dessus de 90 % » est, tant que ce score n’a pas été mesuré contre des résultats réels, une règle appliquée à du bruit. La calibration ne rend pas le modèle plus intelligent et ne réordonne aucune réponse. Elle fait en sorte que le nombre veuille dire ce qu’il annonce, ce qui vous permet de fixer le seuil délibérément plutôt que par accident.

### Comment joindre Ian Rudd ?

Par courriel à ianrudd.phd@gmail.com, ou sur LinkedIn. Il est établi au Canada et travaille avec des équipes réparties sur plusieurs fuseaux horaires, détient la cote de fiabilité approfondie et la cote secret du gouvernement du Canada, et possède un doctorat en apprentissage automatique et en IA ainsi que les certifications Azure Solutions Architect Expert, PMP, CISM, COBIT et TOGAF.

## Entamons la conversation

Stratégie et architecture d’IA et de données d’entreprise, direction d’une équipe de science des données, d’architecture de données ou de recherche, gouvernance des modèles, conception de l’incertitude et de l’évaluation, ou second avis sur un système qui doit être juste. Si vous ne savez pas exactement ce qu’il vous faut, décrivez le symptôme. Cela suffit généralement à trancher.

Me joindre sur LinkedIn

ianrudd.phd@gmail.com

Cote de sécurité

Fiabilité approfondie du gouvernement du Canada, valide jusqu’en novembre 2029

Langues

Français et anglais, tous deux au niveau professionnel complet

Établi au

Canada, en télétravail avec des équipes réparties sur plusieurs fuseaux

Titres

Doctorat en informatique. Azure Solutions Architect Expert, PMP, CISM, COBIT, TOGAF

Aucun nombre sur ce site ne paraît sans indication de sa provenance.

C’est le sens des petites étiquettes colorées. Chacune indique comment le nombre voisin a été obtenu : calculé ici devant vous, dérivé par une arithmétique imprimée sur la figure, ou tiré d’un article listé ci-dessous.
- dérivé dérivé : découle des entrées indiquées par l’arithmétique donnée sur la figure
- mesuré mesuré : calculé dans votre navigateur à partir d’une amorce modifiable
- cité cité : attribué à une source listée parmi les articles
- estimé estimé : une approximation dont l’erreur est indiquée
- illustratif illustratif : choisi pour montrer une forme, non pour rapporter un résultat

Les articles derrière les figures

Chaque note dit ce que l’article règle et ce qu’il laisse ouvert, car c’est dans la seconde partie que se fait l’ingénierie. Tous sont réels, citables, et valent l’après-midi.

Guo, Pleiss, Sun et Weinberger (2017). On Calibration of Modern Neural Networks. ICML.

Établit que l’exactitude et la calibration se sont dissociées à mesure que les réseaux se sont approfondis, et qu’une seule température corrige l’essentiel. Laisse entière la question de la calibration sous dérive, qui est le cas qui compte en production.

Angelopoulos et Bates (2021). A Gentle Introduction to Conformal Prediction. arXiv:2107.07511.

La voie d’entrée la plus claire vers la couverture sans hypothèse de distribution. À lire pour ce que la garantie n’est pas : marginale et non conditionnelle, et caduque dès que l’échangeabilité tombe.

Ovadia et al. (2019). Can You Trust Your Model’s Uncertainty ? NeurIPS.

La réponse empirique est surtout non, et la dégradation suit la dérive. Le résultat négatif le plus utile du domaine ; c’est pourquoi je mesure au lieu de supposer.

Robertson et Zaragoza (2009). The Probabilistic Relevance Framework: BM25 and Beyond.

L’origine de la fonction de classement de la figure 4, avec la dérivation plutôt que la recette. Toujours la bonne première référence, et toujours meilleure que des dispositifs mille fois plus coûteux.

Deerwester et al. (1990). Indexing by Latent Semantic Analysis. JASIS.

L’argument original selon lequel la structure de cooccurrence porte du sens. Son mode de défaillance, des voisins convaincants qui n’en sont pas, est exactement ce que la recherche dense moderne reproduit à grande échelle.

Dwork et Roth (2014). The Algorithmic Foundations of Differential Privacy.

La référence standard pour les mécanismes de la figure 5. Les chapitres sur la composition sont ceux que les équipes sautent, puis dont elles ont besoin.

Narayanan et Shmatikov (2008). Robust De-anonymization of Large Sparse Datasets. IEEE S&P.

Pourquoi retirer les identifiants n’est pas anonymiser. Vingt ans après, c’est encore le moyen le plus rapide de clore un débat sur la publication d’un jeu de données.

Williams, Waterman et Patterson (2009). Roofline: An Insightful Visual Performance Model. CACM.

Le modèle sous la figure 3. Antérieur de quinze ans au matériel actuel, et il explique toujours pourquoi le décodage est lent.

Pope et al. (2023). Efficiently Scaling Transformer Inference. MLSys.

Pose l’argument de la limite mémoire concrètement, avec l’arithmétique de partitionnement détaillée. L’article à remettre à qui pense que le débit est une question de FLOPS.

Sculley et al. (2015). Hidden Technical Debt in Machine Learning Systems. NIPS.

Dix ans après, toujours la description la plus juste de la dégradation de ces systèmes. Rien n’y porte sur la modélisation, et c’est précisément le propos.

Les implémentations des figures sont vérifiées contre des formes closes à chaque compilation.

Composé en Source Serif 4, Instrument Sans et IBM Plex Mono. Les tracés sont en SVG. Aucune analytique, aucun témoin, aucune requête tierce hormis les fichiers de police.
