Un évaluateur tiers devenu incontournable
Image tirée du film L'aile ou la cuisse, où Louis de Funes incarne le propriétaire d'un guide gastronomique
METR (pour Model Evaluation and Threat Research, prononcé « meter », en référence à la métrologie) est une organisation à but non lucratif selon l’article 501(c) (3) du code fiscal américain, l’équivalent d’une association à but non lucratif en France. Son histoire explique en partie ce positionnement : l’équipe est née en 2022 sous le nom d’ARC Evals au sein de l’Alignment Research Center de Paul Christiano, ancien responsable de l’alignement des modèles de langage chez OpenAI. Beth Barnes, elle aussi ancienne chercheuse d’OpenAI, en prend la tête. En décembre 2023, l’équipe est essaimée en entité autonome et rebaptisée METR. Paul Christiano, nommé entre-temps responsable de la sécurité à l’AI Safety Institute américain, a alors renoncé au siège d’administrateur et au rôle de conseiller, qui lui étaient initialement prévus.
La mission que se donne l’organisation est étroite et assumée : développer des méthodes scientifiques d’évaluation des risques majeurs liés aux capacités autonomes des systèmes d’IA. Ce n’est ni un laboratoire d’alignement, ni un cabinet de conformité réglementaire, ni un benchmarkeur de performance produit. Il tourne autour d’une problématique d’actualité, le risque de perte de contrôle par l’Humain, de ses créations artificielles. Un risque largement documenté dans la littérature et le cinéma de science-fiction, et dont l’actualité semble chaque mois se rapprocher un peu plus.
La mission que se donne l’organisation est étroite et assumée : développer des méthodes scientifiques d’évaluation des risques majeurs liés aux capacités autonomes des systèmes d’IA. Ce n’est ni un laboratoire d’alignement, ni un cabinet de conformité réglementaire, ni un benchmarkeur de performance produit. Il tourne autour d’une problématique d’actualité, le risque de perte de contrôle par l’Humain, de ses créations artificielles. Un risque largement documenté dans la littérature et le cinéma de science-fiction, et dont l’actualité semble chaque mois se rapprocher un peu plus.
Son offre s’articule autour de cinq lignes de services
- Les évaluations prédéploiement. METR a mené des campagnes de test avec OpenAI, Anthropic, Google DeepMind, Meta et Amazon, sur des modèles non encore publics. Les conclusions sont publiées, et reprises dans les « system cards » des éditeurs. Les rapports récents portent notamment sur GPT-5.1-Codex-Max et GPT-5.6.
- La mesure de l’autonomie. Le travail le plus cité de l’organisation établit que la durée des tâches qu’un agent d’IA peut mener à bien de façon autonome double environ tous les sept mois depuis six ans. Cette métrique de l’« horizon temporel » est devenue un instrument de prévision utilisé bien au-delà du milieu de la sûreté.
- Les revues indépendantes des analyses de risque des éditeurs. METR examine les évaluations que les développeurs produisent eux-mêmes, et publie son appréciation. L’organisation a par ailleurs piloté une évaluation du risque de déploiement non autorisé d’agents à l’intérieur même des laboratoires, avec la participation d’Anthropic, Google, Meta et OpenAI.
- Les enquêtes post-incident. En 2026, deux collaborateurs de METR et un contractant de Redwood Research ont enquêté sur un incident au cours duquel des agents d’OpenAI se sont échappés de leur environnement de test lors d’une évaluation de cybersécurité pour accéder aux serveurs de Hugging Face.
- La contribution méthodologique aux politiques publiques et internes. METR a prototypé l’approche des « Responsible Scaling Policies », adoptée depuis par neuf développeurs, participe au consortium de l’AI Safety Institute du NIST et à la California Cybersecurity Task Force, est partenaire de l’AI Security Institute britannique et fournit une assistance technique au Bureau européen de l’IA sur l’évaluation des risques de perte de contrôle.
Point essentiel pour comprendre le modèle : rien de tout cela n’est vendu ! METR ne facture pas les entreprises qu’elle évalue. Il n’y a pas de client au sens commercial, donc pas de contrat de prestation, mais pas non plus de relation contractuelle opposable. A contrario, METR ne peut rien évaluer sans l’accord et la participation des entreprises évaluées.
- La mesure de l’autonomie. Le travail le plus cité de l’organisation établit que la durée des tâches qu’un agent d’IA peut mener à bien de façon autonome double environ tous les sept mois depuis six ans. Cette métrique de l’« horizon temporel » est devenue un instrument de prévision utilisé bien au-delà du milieu de la sûreté.
- Les revues indépendantes des analyses de risque des éditeurs. METR examine les évaluations que les développeurs produisent eux-mêmes, et publie son appréciation. L’organisation a par ailleurs piloté une évaluation du risque de déploiement non autorisé d’agents à l’intérieur même des laboratoires, avec la participation d’Anthropic, Google, Meta et OpenAI.
- Les enquêtes post-incident. En 2026, deux collaborateurs de METR et un contractant de Redwood Research ont enquêté sur un incident au cours duquel des agents d’OpenAI se sont échappés de leur environnement de test lors d’une évaluation de cybersécurité pour accéder aux serveurs de Hugging Face.
- La contribution méthodologique aux politiques publiques et internes. METR a prototypé l’approche des « Responsible Scaling Policies », adoptée depuis par neuf développeurs, participe au consortium de l’AI Safety Institute du NIST et à la California Cybersecurity Task Force, est partenaire de l’AI Security Institute britannique et fournit une assistance technique au Bureau européen de l’IA sur l’évaluation des risques de perte de contrôle.
Point essentiel pour comprendre le modèle : rien de tout cela n’est vendu ! METR ne facture pas les entreprises qu’elle évalue. Il n’y a pas de client au sens commercial, donc pas de contrat de prestation, mais pas non plus de relation contractuelle opposable. A contrario, METR ne peut rien évaluer sans l’accord et la participation des entreprises évaluées.
Ce que cela change pour une direction informatique, dans l’analyse des résultats publiés
Trois usages concrets peuvent être envisagés :
- D’abord, les rapports METR sont l’une des rares sources tierces permettant de qualifier les capacités agentiques d’un modèle avant de lui confier un périmètre opérationnel.
- Ensuite, la métrique d’horizon temporel donne un ordre de grandeur défendable pour arbitrer ce qu’on délègue à un agent et ce qu’on maintient sous supervision humaine.
- Enfin, les travaux de METR sur les *Frontier AI Safety Policies* fournissent une grille de questions à poser à un fournisseur en phase de sélection.
Un quatrième enseignement, moins attendu : l’étude randomisée publiée par METR sur la productivité de développeurs open source expérimentés conclut que ceux-ci surestiment systématiquement le bénéfice des outils d’IA. Intéressant à rapprocher des cas d’usage internes qui peuvent être constatés dans les départements informatiques.
- D’abord, les rapports METR sont l’une des rares sources tierces permettant de qualifier les capacités agentiques d’un modèle avant de lui confier un périmètre opérationnel.
- Ensuite, la métrique d’horizon temporel donne un ordre de grandeur défendable pour arbitrer ce qu’on délègue à un agent et ce qu’on maintient sous supervision humaine.
- Enfin, les travaux de METR sur les *Frontier AI Safety Policies* fournissent une grille de questions à poser à un fournisseur en phase de sélection.
Un quatrième enseignement, moins attendu : l’étude randomisée publiée par METR sur la productivité de développeurs open source expérimentés conclut que ceux-ci surestiment systématiquement le bénéfice des outils d’IA. Intéressant à rapprocher des cas d’usage internes qui peuvent être constatés dans les départements informatiques.
Les garde-fous revendiqués
L’organisation a construit un dispositif d’indépendance explicite, et publiquement documenté sur sa page institutionnelle. Cette indépendance est la clef de l’intérêt, et de la crédibilité, portés aux travaux de tout organisme indépendant. Depuis les révélations du Watergate aux États-Unis en 1974, le concept de « follow the money », en dit plus que toute déclaration d’intention officielle. Mais les circuits financiers sont chaque décennie plus complexes à suivre, et parfois… la politique s’en mêle !
Officiellement, METR revendique ne recevoir aucun financement des entreprises d’IA. METR déclare n’avoir jamais accepté le moindre financement provenant des entreprises d’IA. Son budget proviendrait de dons : The Audacious Project, initiative de financement hébergée par TED, à l’origine de son premier financement d’échelle institutionnelle (environ 17 millions de dollars en 2024, dans le cadre d’un engagement d’environ 38 millions partagé avec la RAND Corporation) ; des particuliers ; les fondations Sijbrandij, Pew Charitable Trusts, Schmidt Sciences, Packard, LaCentra-Sumerlin, Astralis ; Expa.org ; l’AI Security Institute ; les fonds mutualisés de Longview Philanthropy et Effektiv Spenden ; le Survival and Flourishing Fund. En août 2026, METR a annoncé avoir levé environ 71 millions de dollars de promesses de financement sur six mois.
METR précise ne percevoir aucune compensation pour les évaluations qu’elle conduit, aucune rémunération en échange de son travail d’évaluation.
METR prévoit une clause de blocage sur les dons individuels. L’organisation indique ne pas pouvoir accepter de dons effectués par des salariés d’entreprises d’IA ni par d’autres particuliers sur instruction des premiers. C’est un garde-fou structurel rarement formalisé à ce niveau, et qui témoigne de la compréhension par METR du fait que tout son travail dépend d’une seule chose, sa réelle indépendance.
Une source de revenus publique, mais qui reste minoritaire. Une part réduite des revenus de METR provient d’un contrat d’assistance technique avec le Bureau européen de l’IA.
La publication systématique de ses travaux est revendiquée par METR, sous-entendu, que cela aille dans le sens de l’organisation auditée ou pas. L’organisation dit publier, autant que possible, l’ensemble de ses travaux et de ses évaluations de risque. Elle indique également évaluer occasionnellement des modèles après leur sortie, sans implication du développeur. L’organisation a par ailleurs rendu publics deux incidents de sécurité la concernant en 2026 : le vol d’une clé d’API pour des modèles publics, puis un sondage systématique de son infrastructure exposée. Bien sûr, cet engagement est déclaratif, et il est impossible de vérifier que tous les travaux réalisés par METR ont bien été publiés.
Officiellement, METR revendique ne recevoir aucun financement des entreprises d’IA. METR déclare n’avoir jamais accepté le moindre financement provenant des entreprises d’IA. Son budget proviendrait de dons : The Audacious Project, initiative de financement hébergée par TED, à l’origine de son premier financement d’échelle institutionnelle (environ 17 millions de dollars en 2024, dans le cadre d’un engagement d’environ 38 millions partagé avec la RAND Corporation) ; des particuliers ; les fondations Sijbrandij, Pew Charitable Trusts, Schmidt Sciences, Packard, LaCentra-Sumerlin, Astralis ; Expa.org ; l’AI Security Institute ; les fonds mutualisés de Longview Philanthropy et Effektiv Spenden ; le Survival and Flourishing Fund. En août 2026, METR a annoncé avoir levé environ 71 millions de dollars de promesses de financement sur six mois.
METR précise ne percevoir aucune compensation pour les évaluations qu’elle conduit, aucune rémunération en échange de son travail d’évaluation.
METR prévoit une clause de blocage sur les dons individuels. L’organisation indique ne pas pouvoir accepter de dons effectués par des salariés d’entreprises d’IA ni par d’autres particuliers sur instruction des premiers. C’est un garde-fou structurel rarement formalisé à ce niveau, et qui témoigne de la compréhension par METR du fait que tout son travail dépend d’une seule chose, sa réelle indépendance.
Une source de revenus publique, mais qui reste minoritaire. Une part réduite des revenus de METR provient d’un contrat d’assistance technique avec le Bureau européen de l’IA.
La publication systématique de ses travaux est revendiquée par METR, sous-entendu, que cela aille dans le sens de l’organisation auditée ou pas. L’organisation dit publier, autant que possible, l’ensemble de ses travaux et de ses évaluations de risque. Elle indique également évaluer occasionnellement des modèles après leur sortie, sans implication du développeur. L’organisation a par ailleurs rendu publics deux incidents de sécurité la concernant en 2026 : le vol d’une clé d’API pour des modèles publics, puis un sondage systématique de son infrastructure exposée. Bien sûr, cet engagement est déclaratif, et il est impossible de vérifier que tous les travaux réalisés par METR ont bien été publiés.
Quelques angles morts subsistent : à surveiller
C’est ici que l’on constate que la formule « indépendance financière » montre parfois des limites : elle ne couvre pas les dépendances qui pèsent le plus lourd dans ce métier. Il est difficile d’évaluer sans l’accord et la participation active de l’évalué !
La contribution en nature. METR le reconnaît sans détour : OpenAI, Anthropic et xAI fournissent des accès et un volume significatif de tokens gratuits, utilisés pour les évaluations, la recherche et l’ingénierie. Ce n’est pas de l’argent, mais cela représente un coût ; c’est un intrant de production offert par les entités évaluées, dont la valeur n’est publiée nulle part. Pour une activité dont le coût marginal est essentiellement du calcul, l’ordre de grandeur n’est pas anecdotique. L’idéal serait évidemment que l’évaluateur paye lui-même ses tokens, comme les inspecteurs des guides gastronomiques (pas les influenceurs…) payent leur addition, sans révéler leur identité en début de repas. Mais cela semble pour l’instant difficile d’atteindre ce niveau de transparence.
La dépendance d’accès : c’est la vraie contrainte. Une évaluation prédéploiement suppose que le développeur accorde un accès anticipé, définisse le périmètre, la profondeur et le calendrier. L’évaluateur ne dispose d’aucun droit d’entrée. L’enquête sur l’incident Hugging Face en donne une illustration : selon les comptes rendus disponibles, les enquêteurs auraient travaillé six jours sur site avec un périmètre restreint à environ une semaine d’événements, alors que la compromission s’est poursuivie au-delà sans être examinée. Des spécialistes de la sécurité plaident pour que les incidents graves déclenchent des investigations indépendantes automatiques, plutôt que de laisser aux laboratoires le soin de décider quand et sur quoi un tiers peut travailler. Là encore, lorsqu’un média teste « en avant-première », un appareil photo, elle est alimentée par le fournisseur… et le modèle testé se révèle parfois différent du modèle finalement commercialisé. Autre solution, l’évaluateur achète un appareil dans le commerce, mais il doit alors attendre la sortie commerciale pour réaliser son test. Quadrature du cercle…
Les circulations du personnel entre les grands acteurs de l’IA. La fondatrice et directrice générale vient d’OpenAI. Alec Radford, chercheur d’OpenAI, figure parmi les conseillers de METR. Le vivier de recrutement et le vivier évalué se recouvrent largement ; ce qui est autant la condition de la compétence technique qu’une source de conflit d’intérêts potentiel. METR ne publie pas de politique écrite officielle de récusation ou de période de carence. A vérifier au cas par cas.
Le profil des financeurs peut poser question : Schmidt Sciences, ou des particuliers issus de la finance quantitative ou du capital-risque technologique ne sont pas des fournisseurs d’IA. Ils ne sont pas pour autant neutres vis-à-vis de la valorisation du secteur. L’absence de financement direct ne dit rien de l’exposition indirecte, ou des intérêts croisés.
Une asymétrie d’échelle de valeurs. Soixante et onze millions de dollars d’engagements face à des dépenses d’investissement par les fournisseurs d’IA qui se comptent en dizaines de milliards chez les entités évaluées. L’évaluateur ne peut pas, structurellement, reproduire l’effort d’ingénierie qu’il audite. Dans un grand nombre de cas, il devra se contenter de déclaratif.
L’absence de mandat public : METR ne dispose d’aucun pouvoir d’injonction, de suspension ou de sanction. Elle constate et publie. Un DSI qui lit un rapport METR lit un avis technique, pas une certification. Faudrait-il transformer ces audits en certifications ? La réponse est politique, et se précisera dans les années à venir.
Ce qui reste non vérifiable dans le modèle de METR : La ventilation des revenus par donateur n’est pas publiée par l’organisation, pas plus que la valorisation des contributions en nature et les clauses de confidentialité conclues avec les développeurs qui ne sont pas publiques. Les formulaires 990 de l’organisation, obligatoires pour une 501(c) (3) et consultables via le Nonprofit Explorer de ProPublica, donnent la structure consolidée des revenus, mais l’annexe détaillée des donateurs n’est pas diffusée.
La contribution en nature. METR le reconnaît sans détour : OpenAI, Anthropic et xAI fournissent des accès et un volume significatif de tokens gratuits, utilisés pour les évaluations, la recherche et l’ingénierie. Ce n’est pas de l’argent, mais cela représente un coût ; c’est un intrant de production offert par les entités évaluées, dont la valeur n’est publiée nulle part. Pour une activité dont le coût marginal est essentiellement du calcul, l’ordre de grandeur n’est pas anecdotique. L’idéal serait évidemment que l’évaluateur paye lui-même ses tokens, comme les inspecteurs des guides gastronomiques (pas les influenceurs…) payent leur addition, sans révéler leur identité en début de repas. Mais cela semble pour l’instant difficile d’atteindre ce niveau de transparence.
La dépendance d’accès : c’est la vraie contrainte. Une évaluation prédéploiement suppose que le développeur accorde un accès anticipé, définisse le périmètre, la profondeur et le calendrier. L’évaluateur ne dispose d’aucun droit d’entrée. L’enquête sur l’incident Hugging Face en donne une illustration : selon les comptes rendus disponibles, les enquêteurs auraient travaillé six jours sur site avec un périmètre restreint à environ une semaine d’événements, alors que la compromission s’est poursuivie au-delà sans être examinée. Des spécialistes de la sécurité plaident pour que les incidents graves déclenchent des investigations indépendantes automatiques, plutôt que de laisser aux laboratoires le soin de décider quand et sur quoi un tiers peut travailler. Là encore, lorsqu’un média teste « en avant-première », un appareil photo, elle est alimentée par le fournisseur… et le modèle testé se révèle parfois différent du modèle finalement commercialisé. Autre solution, l’évaluateur achète un appareil dans le commerce, mais il doit alors attendre la sortie commerciale pour réaliser son test. Quadrature du cercle…
Les circulations du personnel entre les grands acteurs de l’IA. La fondatrice et directrice générale vient d’OpenAI. Alec Radford, chercheur d’OpenAI, figure parmi les conseillers de METR. Le vivier de recrutement et le vivier évalué se recouvrent largement ; ce qui est autant la condition de la compétence technique qu’une source de conflit d’intérêts potentiel. METR ne publie pas de politique écrite officielle de récusation ou de période de carence. A vérifier au cas par cas.
Le profil des financeurs peut poser question : Schmidt Sciences, ou des particuliers issus de la finance quantitative ou du capital-risque technologique ne sont pas des fournisseurs d’IA. Ils ne sont pas pour autant neutres vis-à-vis de la valorisation du secteur. L’absence de financement direct ne dit rien de l’exposition indirecte, ou des intérêts croisés.
Une asymétrie d’échelle de valeurs. Soixante et onze millions de dollars d’engagements face à des dépenses d’investissement par les fournisseurs d’IA qui se comptent en dizaines de milliards chez les entités évaluées. L’évaluateur ne peut pas, structurellement, reproduire l’effort d’ingénierie qu’il audite. Dans un grand nombre de cas, il devra se contenter de déclaratif.
L’absence de mandat public : METR ne dispose d’aucun pouvoir d’injonction, de suspension ou de sanction. Elle constate et publie. Un DSI qui lit un rapport METR lit un avis technique, pas une certification. Faudrait-il transformer ces audits en certifications ? La réponse est politique, et se précisera dans les années à venir.
Ce qui reste non vérifiable dans le modèle de METR : La ventilation des revenus par donateur n’est pas publiée par l’organisation, pas plus que la valorisation des contributions en nature et les clauses de confidentialité conclues avec les développeurs qui ne sont pas publiques. Les formulaires 990 de l’organisation, obligatoires pour une 501(c) (3) et consultables via le Nonprofit Explorer de ProPublica, donnent la structure consolidée des revenus, mais l’annexe détaillée des donateurs n’est pas diffusée.
Ce qui ferait progresser la transparence et l’efficacité
Six pistes peuvent être proposées, dont aucune ne suppose de changement de modèle économique :
1. Chiffrer et publier les contributions en nature. Faire figurer dans les états financiers une valorisation des tokens et accès offerts, par entreprise donatrice. C’est la donnée manquante la plus facile à produire, et la plus structurante pour juger du degré réel d’indépendance.
2. Publier un contrat type d’évaluation. Périmètre minimal, durée d’accès, droit de publication sans veto, délai d’embargo maximal, conditions de rupture. Un modèle public permettrait de constater, à chaque campagne, ce qui a été concédé ou refusé.
3. Tenir un registre public des refus. Publier les demandes d’accès non satisfaites, les périmètres réduits et les évaluations abandonnées. L’information sur ce qui n’a pas pu être testé vaut souvent beaucoup plus que le résultat des tests réalisés. Pour l’instant c’est un peu comme si seuls les restaurants valorisés 5 étoiles sur Google Maps affichaient leur note. A contrario, c’est le cas des guides gastronomiques, qui ne publient pas les informations des restaurants rejetés. La notion de transparence n’est pas binaire…
4. Formaliser une politique de conflits d’intérêts. Période de carence pour les recrues issues des laboratoires, règles de récusation sur l’évaluation de leur ancien employeur, déclaration des participations financières des dirigeants et conseillers.
5. Diversifier vers le financement public et mutualisé. Le contrat avec le Bureau européen de l’IA et le partenariat avec l’AI Security Institute britannique tracent une voie : des crédits de calcul publics ou mutualisés élimineraient la dépendance aux tokens offerts.
6. Renforcer la reproductibilité. Publication systématique des suites de tâches, des protocoles et des échafaudages d’agents, pour permettre à des tiers, y compris des entreprises utilisatrices, de rejouer les évaluations sur leurs propres déploiements.
1. Chiffrer et publier les contributions en nature. Faire figurer dans les états financiers une valorisation des tokens et accès offerts, par entreprise donatrice. C’est la donnée manquante la plus facile à produire, et la plus structurante pour juger du degré réel d’indépendance.
2. Publier un contrat type d’évaluation. Périmètre minimal, durée d’accès, droit de publication sans veto, délai d’embargo maximal, conditions de rupture. Un modèle public permettrait de constater, à chaque campagne, ce qui a été concédé ou refusé.
3. Tenir un registre public des refus. Publier les demandes d’accès non satisfaites, les périmètres réduits et les évaluations abandonnées. L’information sur ce qui n’a pas pu être testé vaut souvent beaucoup plus que le résultat des tests réalisés. Pour l’instant c’est un peu comme si seuls les restaurants valorisés 5 étoiles sur Google Maps affichaient leur note. A contrario, c’est le cas des guides gastronomiques, qui ne publient pas les informations des restaurants rejetés. La notion de transparence n’est pas binaire…
4. Formaliser une politique de conflits d’intérêts. Période de carence pour les recrues issues des laboratoires, règles de récusation sur l’évaluation de leur ancien employeur, déclaration des participations financières des dirigeants et conseillers.
5. Diversifier vers le financement public et mutualisé. Le contrat avec le Bureau européen de l’IA et le partenariat avec l’AI Security Institute britannique tracent une voie : des crédits de calcul publics ou mutualisés élimineraient la dépendance aux tokens offerts.
6. Renforcer la reproductibilité. Publication systématique des suites de tâches, des protocoles et des échafaudages d’agents, pour permettre à des tiers, y compris des entreprises utilisatrices, de rejouer les évaluations sur leurs propres déploiements.
En conclusion pour une entreprise
Les rapports METR constituent aujourd’hui la meilleure source tierce disponible sur les capacités dangereuses des modèles frontières d’IA, et leur qualité méthodologique n’est pas sérieusement contestée. Ils ne constituent ni une certification, ni une garantie contractuelle, ni un audit exhaustif : ce sont des évaluations conduites avec l’accord et dans les limites fixées par l’entité évaluée. Ces rapports doivent être traités comme un avis d’expert indépendant bien informé, pas comme un rapport de commissaire aux comptes. Et être complétés, en phase de sélection de fournisseurs, par des questions directes sur le périmètre exact d’accès qui a été accordé à l’évaluateur, et par un contrat « en béton » négocié par votre service juridique et l’appui d’un avocat.
Autres articles
-
Salesforce et Anthropic annoncent Claudeforce : l’alliance de Claude et de Salesforce pour une nouvelle génération d’IA d’entreprise
-
Databricks et OpenAI annoncent un partenariat stratégique pour démocratiser l’IA de dernière génération grâce à Databricks Agent Bricks
-
Veeam met la protection des données au service de l’IA en intégrant le MCP d’Anthropic
-
Elasticsearch Open Inference API prend désormais en charge Claude d’Anthropic
-
Netskope annonce son intégration à ChatGPT Enterprise d’OpenAI, pour renforcer la gouvernance et la conformité des données





