Les tests de performance traditionnels en matière d’IA ne tiennent pas compte des contraintes de performance rencontrées dans la réalité

La plupart des débats sur les infrastructures d’IA continuent de se concentrer sur les indicateurs évidents : nombre de GPU, vitesse d’entraînement, capacité du cloud et résultats aux tests de performance. Ces chiffres ont certes leur importance, mais ils ne constituent qu’une partie du système. La véritable question est bien plus simple : les données peuvent-elles atteindre vos ressources de calcul de manière constante lorsque l’environnement devient imprévisible ?

C’est là que de nombreux déploiements d’IA commencent à rencontrer des difficultés. Les tests de performance sont généralement réalisés dans des environnements soigneusement contrôlés, où les réseaux se comportent exactement comme prévu. Ce n’est pas le cas dans les environnements de production. Les schémas de trafic changent d’une minute à l’autre. La latence du réseau augmente de manière imprévisible. Certains nœuds de stockage ralentissent ou deviennent temporairement indisponibles. Ces conditions sont normales dans les systèmes d’entreprise à grande échelle, mais elles sont souvent absentes des tests de performance.

Il en résulte un écart croissant entre les performances attendues et les résultats opérationnels réels. Un système qui semble très performant lors des tests peut afficher des performances bien inférieures après son déploiement. Des GPU coûtant des millions de dollars peuvent passer un temps précieux à attendre des données au lieu de les traiter. Lorsque cela se produit, une infrastructure qui semble pleinement opérationnelle ne parvient toujours pas à générer le rendement escompté.

Hunter Smit, responsable senior du marketing produit chez F5, a clairement résumé la question : « L’approvisionnement résout le problème de la capacité, mais pas celui de la diffusion. » Son argument est que l’achat d’un nombre suffisant de GPU et de capacités de stockage ne garantit pas automatiquement la mise en place d’une plateforme d’IA efficace. Le trafic lié à l’IA est fondamentalement différent des charges de travail d’entreprise traditionnelles. Il est hautement concurrentiel, arrive par rafales et sollicite souvent des données selon des schémas aléatoires que les réseaux de stockage conventionnels n’ont jamais été conçus pour gérer efficacement.

Pour les dirigeants, cela modifie la manière dont l’infrastructure d’IA doit être évaluée. Le débat doit aller au-delà des spécifications matérielles et des classements de performances pour s’intéresser au comportement du système de bout en bout. Chaque couche, du stockage au calcul, contribue aux performances de l’entreprise. Si ce parcours devient peu fiable, même le matériel d’IA le plus puissant ne pourra pas compenser cette défaillance.

Cela a également des implications stratégiques plus larges. À mesure que les organisations intègrent l’IA dans leurs produits destinés aux clients et dans leurs opérations métier clés, des performances prévisibles deviennent plus importantes que des performances de pointe. Les clients perçoivent l’application comme un service complet. Ils ne distinguent pas les composants individuels que sont le calcul, le stockage, la mise en réseau ou la sécurité. Ils remarquent simplement si le système répond rapidement et de manière constante.

C’est pourquoi de plus en plus d’entreprises considèrent la diffusion des données comme une capacité stratégique plutôt que comme une simple fonction d’infrastructure en arrière-plan. Des technologies telles que les contrôleurs de diffusion d’applications (ADC) et les plateformes de diffusion et de sécurité des applications (ADSP) sont de plus en plus souvent déployées entre le stockage et les ressources de calcul afin de surveiller l’état du système, d’améliorer la résilience et de maintenir les performances lorsque les conditions du réseau évoluent inévitablement. L’objectif est de disposer d’une IA qui fonctionne de manière fiable dans les environnements où les entreprises opèrent réellement.

Les méthodologies de référence aboutissent souvent à des résultats de performance trop optimistes

Les tests de performance sont utiles, mais uniquement s’ils mesurent des conditions qui existent réellement. Ce n’est pas le cas de nombreux tests de performance consacrés aux infrastructures d’IA. Ceux-ci sont conçus pour obtenir les chiffres de performance les plus élevés possibles. Cela pose problème, car les systèmes d’IA d’entreprise fonctionnent rarement dans des conditions idéales.

L’un des principaux facteurs est la latence du réseau. La latence correspond simplement au délai entre la demande de données et leur réception. Même de légères augmentations de la latence peuvent réduire considérablement la vitesse à laquelle les systèmes d’IA reçoivent les données provenant de plateformes de stockage d’objets telles que le stockage compatible Amazon S3. Contrairement aux applications d’entreprise traditionnelles, les charges de travail d’IA reposent souvent sur des milliers de GPU fonctionnant simultanément. Ces légers retards prennent une ampleur considérable lorsqu’ils sont multipliés à l’échelle de l’ensemble du cluster.

Paul Pindell, architecte principal des solutions pour les alliances technologiques chez F5, a expliqué que « pour être pertinents, les tests doivent introduire une latence constante dans le chemin ». Sans cela, les résultats des tests de performance reflètent un environnement que les systèmes de production ne rencontreront pratiquement jamais.

Afin d’examiner cette question de plus près, F5 et MinIO ont mené des tests de débit dans des conditions réseau dégradées. Leurs résultats ont montré que le débit de S3 diminuait rapidement à mesure que la latence augmentait. Même une latence relativement modeste entraînait une perte de performances mesurable. À mesure que la latence se rapprochait des niveaux couramment observés sur les connexions réseau longue distance, la dégradation du débit devenait importante.

Un résultat s’est particulièrement démarqué. Les tests ont révélé que la latence avait un impact bien plus important sur le débit que la gigue du réseau. Ce constat a remis en question les hypothèses initiales de l’équipe et constitue un enseignement important pour la planification des infrastructures. Les entreprises s’attachent souvent à réduire la variabilité des performances du réseau, mais une réduction constante de la latence pourrait avoir un effet bien plus significatif sur les performances de l’IA.

Pour les dirigeants chargés de prendre des décisions en matière d’investissements dans les infrastructures, cela modifie la définition d’un test réussi. Un test de performance ne doit pas servir à déterminer si un système fonctionne correctement dans des conditions idéales. Il doit permettre de vérifier si le système continue de fonctionner lorsque les conditions ne sont plus idéales, car c’est précisément l’environnement auquel les clients et les collaborateurs seront confrontés au quotidien.

Cela a également des implications financières. Les décisions fondées uniquement sur les résultats des tests de performance peuvent conduire les organisations à investir massivement dans des ressources de calcul supplémentaires tout en négligeant le véritable goulot d’étranglement. Si le chemin de données n’est pas en mesure de fournir des informations de manière constante aux GPU, l’ajout de GPU supplémentaires ne fait qu’augmenter la capacité inutilisée au lieu d’accroître la valeur ajoutée pour l’entreprise.

L’approche la plus aboutie consiste à intégrer dès le départ les conditions de production au processus de test. La simulation, lors de l’évaluation, d’une latence réaliste, de liaisons réseau dégradées et de pannes des nœuds de stockage permet de prendre des décisions en matière d’infrastructure qui ont bien plus de chances de garantir des performances prévisibles après le déploiement. Dans le domaine de l’IA d’entreprise, la cohérence dans des conditions d’exploitation réelles a, en fin de compte, plus de valeur que des chiffres impressionnants obtenus dans un laboratoire contrôlé.

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.

L’efficacité du chemin de données entre le stockage et le calcul est essentielle à la performance globale du système d’IA et à son retour sur investissement

Le débat sur l’infrastructure d’IA commence souvent par les GPU, car ceux-ci sont coûteux, très visibles et faciles à évaluer. Cette approche est compréhensible, mais elle est incomplète. Un GPU ne crée de la valeur que s’il dispose d’un flux continu de données. Si les données arrivent lentement ou de manière irrégulière, le GPU reste en attente. Ce temps d’attente réduit directement le retour sur investissement d’une entreprise dans l’IA.

Le parcours « du stockage au calcul » ne se limite pas au stockage proprement dit. Les données transitent par le réseau, les bases de données, les contrôles de sécurité, les logiciels d’orchestration et l’infrastructure distribuée avant d’atteindre la couche de calcul. Chaque composant contribue aux performances globales du système. Si l’un d’entre eux devient un goulot d’étranglement, c’est l’ensemble du pipeline d’IA qui en subit les conséquences.

Tanu Mutreja, directrice principale de la gestion des produits chez F5, a insisté sur ce point en soulignant que « dans les environnements de production, les GPU ne génèrent de valeur qu’à hauteur de celle du flux de données qui les alimente ». Cela reflète une évolution importante dans la stratégie des entreprises en matière d’IA. Les organisations doivent considérer leur infrastructure comme un système intégré plutôt que comme un ensemble de technologies indépendantes.

L’impact d’un chemin de données inefficace ne se limite pas à une baisse du taux d’utilisation du GPU. Les tâches d’entraînement peuvent prendre plus de temps à s’achever, ce qui retarde le développement des produits et les expérimentations. Les systèmes d’inférence peuvent réagir plus lentement, ce qui affecte l’expérience client et les opérations commerciales. Une transmission des données défaillante peut également nuire à la qualité des résultats générés par l’IA si les modèles ne parviennent pas à accéder efficacement aux données pertinentes au moment où ils en ont besoin.

Les coûts d’exploitation augmentent également. Les organisations peuvent être amenées à dupliquer inutilement des données sur plusieurs sites pour pallier un réseau peu fiable, ce qui entraîne une hausse des coûts de stockage et de trafic sortant. Les équipes d’ingénierie consacrent par ailleurs davantage de temps au diagnostic des problèmes d’infrastructure qu’à l’amélioration des applications d’IA. À mesure que les déploiements prennent de l’ampleur, ces inefficacités opérationnelles deviennent de plus en plus difficiles et coûteuses à gérer.

Les charges de travail d’IA sont particulièrement sensibles à ces problèmes, car elles s’exécutent généralement sur de vastes clusters de GPU fonctionnant simultanément. Les applications d’entreprise traditionnelles atténuent souvent l’impact des retards de stockage grâce à la mise en cache et à la mise en tampon. De nombreuses charges de travail d’IA ont moins de possibilités de masquer les retards liés à l’infrastructure. Même des augmentations relativement faibles de la latence ou des contraintes temporaires de bande passante peuvent affecter simultanément une grande partie d’une charge de travail distribuée de formation ou d’inférence.

Pour les dirigeants, cela signifie que les décisions d’investissement en infrastructures doivent être évaluées à l’aune des résultats commerciaux. Une meilleure utilisation des GPU, une mise à disposition plus rapide des modèles, une réactivité accrue des applications et une complexité opérationnelle réduite contribuent toutes directement à un meilleur retour sur investissement en matière d’IA. Les organisations qui optimisent l’ensemble du parcours des données tireront généralement davantage de valeur des ressources de calcul dont elles disposent déjà avant d’acheter des capacités supplémentaires.

L’intégration de l’intelligence dans le parcours des données de l’IA est essentielle pour s’adapter aux défis liés à la production

L’architecture d’entreprise évolue, car l’IA modifie la manière dont les données sont utilisées. Dans de nombreux systèmes traditionnels, les données étaient d’abord stockées, puis traitées ultérieurement. Les applications d’IA nécessitent un flux continu de données entre le stockage et le calcul, souvent à très grande échelle et avec des exigences de performances élevées. Le cheminement des données devient ainsi un élément actif de l’application, plutôt qu’une simple connexion passive.

Tanu Mutreja a expliqué que l’avantage concurrentiel dépend désormais de la quantité de données dont dispose une organisation, ainsi que de leur pertinence, de leur traçabilité, de leur sécurité et de la capacité à les diffuser efficacement. Cela reflète une tendance plus générale dans le secteur des technologies, où l’intelligence est de plus en plus intégrée directement dans l’infrastructure plutôt que d’y être ajoutée a posteriori.

L’un des exemples concrets décrits est l’intégration de F5 avec MinIO. Au sein de la plateforme F5 Application Delivery and Security Platform (ADSP), BIG-IP intervient directement dans le chemin de données entre le stockage et les ressources de calcul. Plutôt que de se contenter de transférer les requêtes, il surveille en permanence l’état de santé des nœuds de stockage distribués de MinIO et prend des décisions de routage en fonction des conditions de fonctionnement du moment.

Cette fonctionnalité s’avère particulièrement utile lorsque les nœuds de stockage commencent à présenter des défaillances, ce qui est inévitable à terme dans les environnements distribués. En l’absence d’une gestion intelligente du trafic, les requêtes risquent d’être adressées à plusieurs reprises à des nœuds défaillants avant de trouver finalement un nœud capable de répondre correctement. Ces tentatives répétées augmentent la latence, consomment davantage de ressources réseau et réduisent l’efficacité globale du système.

Paul Pindell, architecte principal des solutions pour les alliances technologiques chez F5, a expliqué que BIG-IP oriente le trafic des clients S3 vers des nœuds de stockage opérationnels ou moins sollicités, afin que les requêtes soient traitées de la manière la plus efficace possible. Cela permet au système de s’adapter de manière dynamique à l’évolution des conditions de l’infrastructure, plutôt que de s’appuyer sur des décisions de routage statiques.

Pour les dirigeants d’entreprise, cette approche présente une valeur stratégique qui va au-delà des performances techniques. Une infrastructure qui s’adapte en permanence à l’évolution des conditions permet un comportement plus prévisible des applications, améliore la disponibilité des services et réduit les perturbations opérationnelles. À mesure que l’IA s’intègre dans les produits destinés aux clients et dans les processus métier critiques, ces caractéristiques deviennent indispensables plutôt que facultatives.

L’intégration de l’intelligence dans le chemin des données renforce également l’évolutivité à long terme. Les environnements d’IA ne cessent de gagner en taille et en complexité, couvrant un nombre croissant d’utilisateurs, de données et de sites d’infrastructure. Dans ces conditions, les architectures statiques deviennent de plus en plus difficiles à exploiter. Une infrastructure intelligente, capable de surveiller l’état du système et de s’adapter automatiquement, offre une base plus résiliente pour les extensions futures, tout en allégeant la charge opérationnelle pesant sur les équipes d’ingénierie.

Les déploiements d’IA multi-cloud et distribués nécessitent une gouvernance centralisée pour garantir la souveraineté numérique et la résilience

À mesure que les déploiements d’IA se développent, les décisions relatives à l’infrastructure ne se limitent plus à la seule question des performances. Les entreprises exploitent de plus en plus souvent leurs charges de travail d’IA sur plusieurs clouds publics, centres de données privés et sites périphériques. Cela offre une certaine flexibilité, mais soulève également de nouveaux défis en matière de gouvernance, de conformité et de contrôle opérationnel.

L’un des aspects les plus importants à prendre en compte est la souveraineté numérique. Dans de nombreux pays, la réglementation définit où les données peuvent être stockées, comment elles peuvent être traitées et qui est autorisé à y accéder. Ces exigences deviennent désormais un élément central de la planification des infrastructures d’IA, plutôt qu’un simple contrôle de conformité effectué après le déploiement.

Hunter Smit, responsable senior du marketing produit chez F5, a expliqué qu’une fois que les pipelines d’IA s’étendent à plusieurs régions et fournisseurs de cloud, le débat ne porte plus sur les performances, mais sur le contrôle. Les différentes juridictions imposent des exigences légales et réglementaires variées, ce qui signifie que l’architecture d’entreprise doit être conçue pour garantir l’application cohérente de ces politiques dans tous les environnements.

Cela s’inscrit dans une tendance plus générale en matière d’IA d’entreprise. Certaines organisations transfèrent certaines charges de travail liées à l’IA depuis des plateformes de cloud public vers une infrastructure dont elles sont propriétaires ou qu’elles gèrent directement. L’objectif est de réduire les coûts, mais aussi d’améliorer la visibilité, de renforcer la gouvernance et de conserver un meilleur contrôle sur les données sensibles et les opérations d’IA.

Une couche de contrôle centralisée permet de relever ces défis. Au lieu de lier étroitement les applications à une seule plateforme de stockage ou à un seul fournisseur de services cloud, les entreprises peuvent mettre en place une couche de gestion qui applique des politiques cohérentes, quel que soit l’emplacement des données. Cela permet aux équipes chargées de l’infrastructure de gérer la sécurité, les contrôles d’accès, les politiques de routage et les exigences de conformité dans une perspective opérationnelle unifiée.

Pour les dirigeants, cette approche offre une plus grande flexibilité à long terme. Les priorités métier, les exigences réglementaires et l’expansion géographique ne cesseront d’évoluer. Une infrastructure conçue autour d’une gouvernance centralisée permet aux organisations de s’adapter sans avoir à refondre leurs applications d’IA chaque fois que des données doivent être transférées d’un environnement à un autre ou que de nouvelles obligations de conformité apparaissent.

Cela permet également de réduire la complexité opérationnelle. La gestion indépendante de plusieurs fournisseurs de cloud, de plateformes de stockage et de réglementations régionales entraîne une fragmentation des opérations et augmente le risque d’une application incohérente des politiques. Un modèle de gouvernance unifié améliore la cohérence tout en aidant les organisations à trouver un équilibre entre résilience, conformité et coûts dans le cadre d’une stratégie d’entreprise unique.

Gérer la connexion entre le stockage et le calcul en tant qu’interface contrôlable et conçue à cet effet

De nombreuses architectures d’IA partent encore du principe que la connexion entre le stockage et les ressources de calcul n’est qu’une simple couche de transport. Cette hypothèse ne correspond plus à la réalité de l’IA en production. À mesure que les charges de travail gagnent en volume et en dispersion, le chemin de transmission lui-même nécessite une gestion active.

Hunter Smit recommande de considérer la connexion entre le stockage et les ressources de calcul comme un point de contrôle géré plutôt que comme une connexion directe. L’intégration d’un contrôleur de livraison d’applications (ADC) à proxy complet entre le stockage et les ressources de calcul offre une visibilité continue sur l’état du système, tout en permettant aux entreprises de gérer le trafic de manière intelligente à mesure que les conditions évoluent.

Cela présente plusieurs avantages opérationnels. Le routage basé sur l’état de santé permet de détourner automatiquement les requêtes des nœuds de stockage défaillants. Les politiques de qualité de service peuvent donner la priorité aux charges de travail critiques pendant les périodes de forte demande. Les contrôles de sécurité peuvent être appliqués directement au sein du chemin de données, au lieu d’être ajoutés sous forme de couches distinctes ailleurs dans l’infrastructure. Ensemble, ces fonctionnalités améliorent la fiabilité sans nécessiter de modifications des applications d’IA elles-mêmes.

L’intérêt de cette approche s’accroît à mesure que l’infrastructure d’IA se développe. Les environnements distribués sont inévitablement confrontés à des pannes matérielles, à des congestions réseau temporaires et à l’évolution des exigences en matière de charge de travail. Un point de contrôle spécialement conçu permet aux organisations de réagir automatiquement à ces événements, ce qui réduit les interruptions de service et garantit des performances applicatives plus stables.

SecureIQLab a validé de manière indépendante la solution F5 BIG-IP dans des déploiements de stockage, confirmant que cette architecture permet d’améliorer la résilience tout en préservant le débit. Il s’agit là d’un élément important à prendre en compte pour les dirigeants qui évaluent des investissements en infrastructure, car la résilience suscite souvent des inquiétudes quant à des coûts supplémentaires ou à une baisse des performances. Cette validation suggère que les entreprises ne sont pas nécessairement obligées de sacrifier les performances au profit d’une plus grande stabilité opérationnelle.

D’un point de vue commercial, cette approche fait passer la fourniture de données d’une capacité considérée comme acquise à une capacité activement gérée et mesurée. Cette distinction revêt une importance croissante à mesure que l’IA passe du stade expérimental à celui des opérations stratégiques. Une fourniture de données fiable permet une meilleure utilisation des GPU, des performances applicatives plus prévisibles, une mise en œuvre plus rigoureuse de la sécurité et une utilisation plus efficace des investissements en infrastructure.

La leçon générale à en tirer est que l’infrastructure d’IA doit être considérée comme un système d’exploitation complet dédié au transfert des données, et non pas simplement comme un ensemble de ressources de calcul et de stockage. Les organisations qui intègrent directement la visibilité, le contrôle et la résilience dans le parcours allant du stockage au calcul seront mieux à même de développer leurs initiatives en matière d’IA tout en préservant la cohérence opérationnelle et en optimisant le retour sur investissement à long terme.

Principaux faits marquants

  • Ne vous fiez pas uniquement aux résultats des tests de performance : les tests de performance en matière d’IA mesurent des conditions idéales. Les dirigeants doivent évaluer les performances de l’infrastructure en cas de latence, de défaillances de nœuds et de trafic imprévisible, car ce sont ces facteurs qui, en fin de compte, déterminent les résultats de l’entreprise.
  • Tests en vue de la mise en production : les choix d’infrastructure fondés sur des benchmarks représentant le scénario le plus favorable peuvent entraîner des écarts de performances coûteux après le déploiement. Intégrez dans vos tests des valeurs réalistes de latence réseau et des conditions de fonctionnement dégradées afin de mieux prévoir les performances de l’IA à grande échelle.
  • Optimisez l’ensemble du parcours des données : les GPU ne sont rentables que s’ils reçoivent des données de manière constante et efficace. Les dirigeants doivent investir dans l’ensemble du parcours, du stockage au calcul, afin d’améliorer le taux d’utilisation, de réduire les coûts d’exploitation et d’optimiser le retour sur investissement de l’IA.
  • Intégrer l’intelligence dans l’infrastructure : les plateformes d’IA doivent surveiller activement l’état du système et s’adapter à l’évolution des conditions, plutôt que de s’appuyer sur un routage statique. La diffusion intelligente des données améliore la résilience, la réactivité des applications et l’efficacité opérationnelle sans nécessiter de modifications des charges de travail liées à l’IA.
  • Intégrez la gouvernance à l’architecture de l’IA : à mesure que l’IA s’étend à travers les clouds et les régions, un contrôle centralisé devient essentiel pour répondre aux exigences en matière de conformité, de souveraineté numérique et de sécurité. Concevez une infrastructure qui garantisse l’application de politiques cohérentes dans tous les environnements, tout en préservant la flexibilité opérationnelle.
  • Considérez la diffusion des données comme une capacité stratégique : l’interconnexion entre le stockage et la puissance de calcul doit être gérée de manière active grâce à des contrôles en matière de visibilité, de routage basé sur l’état de santé des systèmes, de sécurité et de qualité de service. Cette approche améliore la résilience, garantit la productivité des ressources de calcul coûteuses et favorise l’évolutivité à long terme de l’IA.

Alexander Procter

juillet 31, 2026

21 Min

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.