L’inférence en IA passe d’un goulot d’étranglement lié au calcul à un goulot d’étranglement lié à la gestion du contexte

Pendant des années, le discours sur l’IA était simple : il fallait acheter davantage de GPU. Cela se justifiait lorsque l’entraînement de modèles volumineux constituait le principal défi. Aujourd’hui, la donne évolue. L’IA passe de la réponse à des questions ponctuelles à l’exécution de flux de travail continus en plusieurs étapes. Ces systèmes mémorisent les interactions précédentes, prennent des décisions au fil du temps et poursuivent leur travail sur plusieurs sessions. Cela modifie les facteurs qui limitent les performances.

La nouvelle contrainte, c’est le contexte. Le contexte désigne les informations qu’un système d’IA conserve à sa disposition afin de pouvoir poursuivre une conversation, mener à bien une tâche ou coordonner une séquence d’actions sans devoir repartir de zéro. Chaque fenêtre de contexte plus large, chaque appel de modèle supplémentaire et chaque élément d’état conservé augmentent la quantité de données qui doivent être stockées et récupérées rapidement. À mesure que les entreprises adoptent des agents d’IA pour leurs opérations commerciales, leur service client, le développement de logiciels et leurs flux de travail internes, cette demande ne cesse de croître.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, affirme que cette question est désormais devenue le enjeu central en matière d’infrastructure. Selon M. Harthorn, les progrès réalisés en matière de coût par opération en virgule flottante (FLOP) des GPU, d’architectures de modèles et de moteurs d’inférence ont été considérables. Cependant, la croissance du contexte, et en particulier de l’état persistant qui se maintient d’une session à l’autre, a été encore plus rapide.

Cette évolution a des implications concrètes pour les entreprises. De nombreuses organisations évaluent encore leur infrastructure d’IA principalement en fonction du nombre de GPU ou de la capacité de calcul. Ces indicateurs restent importants, mais ils ne reflètent plus la réalité dans son ensemble. Si un système d’IA n’est pas capable de gérer efficacement son contexte, l’ajout de ressources de calcul supplémentaires entraîne des rendements décroissants, car les accélérateurs coûteux passent davantage de temps à attendre des données ou à reconstituer des informations qu’ils ont déjà traitées.

Ace Stryker, directeur du marketing IA et écosystème chez Solidigm, souligne que plusieurs tendances du secteur sont à l’origine simultanée de cette évolution. Les fenêtres contextuelles ne cessent de s’étendre. Les systèmes d’IA « agentique » exécutent régulièrement des dizaines, voire des centaines d’appels de modèles interconnectés. Les entreprises exigent également de plus en plus que l’état d’inférence soit conservé à des fins de gouvernance, de conformité, d’audit et de réutilisation future. Ensemble, ces tendances entraînent une croissance des données que les architectures de mémoire existantes n’ont jamais été conçues pour prendre en charge.

Pour les équipes de direction, cela représente un changement majeur dans les priorités d’investissement. L’avantage concurrentiel dépendra de plus en plus de l’efficacité avec laquelle les organisations gèrent le contexte de l’IA, et non plus simplement de la puissance de calcul dont elles disposent. Les entreprises qui en prendront conscience rapidement pourront améliorer l’utilisation de leur infrastructure, réduire leurs coûts d’exploitation et prendre en charge des applications d’IA plus avancées sans avoir à augmenter leurs capacités matérielles au même rythme que la demande.

L’inférence en IA nécessite une architecture de stockage qui diffère fondamentalement de celle utilisée pour l’entraînement en IA

L’entraînement et l’inférence répondent à des problématiques différentes. Il ne faut pas s’attendre à ce qu’ils fonctionnent efficacement sur une infrastructure identique.

L’entraînement est en grande partie séquentiel. Des ensembles de données volumineux transitent par le système, les modèles apprennent à partir de ces données, et le stockage est optimisé pour des opérations à haut débit impliquant de nombreuses écritures. L’architecture traditionnelle, composée de la mémoire des GPU, d’un stockage NVMe local rapide et d’un stockage en réseau de grande capacité, convient parfaitement à cet usage, car la charge de travail est prévisible et les données circulent par blocs volumineux.

L’inférence fonctionne de manière très différente. Une fois qu’un modèle est déployé, sa valeur dépend de sa capacité à répondre rapidement tout en conservant le contexte. Au lieu de traiter de grands lots de données, l’inférence accède de manière répétée à de plus petites portions d’informations avec des exigences de latence très faibles. Cela inclut le cache clé-valeur (KV), qui stocke les informations d’attention précédemment calculées afin que le modèle n’ait pas à les recalculer, ainsi que les données de récupération utilisées pour compléter les réponses du modèle par des connaissances externes. Ces deux éléments doivent être disponibles presque instantanément pour que le système puisse fournir des résultats rapides et cohérents.

Le défi réside dans le fait que ni la mémoire GPU existante, ni le stockage traditionnel n’ont été conçus pour remplir ce rôle. La mémoire à large bande passante (HBM) des GPU est extrêmement rapide, mais coûteuse et soumise à des contraintes physiques. Le stockage réseau classique offre une grande capacité, mais ne parvient pas à garantir de manière constante la latence requise pour les charges de travail d’inférence active. Il en résulte un décalage architectural entre les couches de stockage les plus rapides et les plus lentes.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, estime que c’est au niveau de cette couche intermédiaire que se concentre aujourd’hui une grande partie de l’innovation en matière d’infrastructure. Selon M. Harthorn, les systèmes situés en dessous de la mémoire des GPU sont de plus en plus sollicités pour effectuer des tâches pour lesquelles ils n’ont jamais été conçus, ce qui ouvre la voie à des approches d’infrastructure entièrement nouvelles.

L’une des conséquences visibles est la réalisation de calculs superflus. Avant qu’un modèle d’IA ne commence à générer de nouveaux résultats, il traite le contexte existant au cours de ce que l’on appelle la phase de préremplissage. Si le cache KV généré précédemment ne peut pas être récupéré rapidement, le modèle le recrée à partir de zéro. Ces cycles de GPU ne génèrent aucune nouvelle valeur ajoutée. Ils se contentent de restaurer des informations qui existaient déjà.

C’est pourquoi les responsables des infrastructures commencent à s’intéresser à des indicateurs d’efficacité allant au-delà des simples performances brutes. Au lieu de se contenter de mesurer le nombre de jetons générés par dollar, nombreux sont ceux qui évaluent désormais le « goodput », c’est-à-dire la quantité de travail utile accompli par dollar après élimination des calculs inutiles. L’amélioration de l’architecture de stockage peut augmenter le « goodput » sans nécessiter de GPU supplémentaires, ce qui en fait l’un des moyens les plus efficaces d’améliorer la rentabilité de l’infrastructure à mesure que les déploiements d’IA continuent de prendre de l’ampleur.

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.

Un niveau de mémoire dédié au contexte est en train d’apparaître entre la mémoire du GPU et le stockage de masse traditionnel

La pile d’infrastructure d’IA évolue, car les couches de mémoire et de stockage existantes ne suffisent plus pour les charges de travail d’inférence modernes. Un nouveau niveau de mémoire de contexte fait son apparition entre la mémoire du GPU et le stockage réseau traditionnel. Son objectif est simple : stocker et fournir le contexte d’inférence suffisamment rapidement pour que les systèmes d’IA puissent continuer à fonctionner sans avoir à reconstituer à plusieurs reprises les informations qu’ils ont déjà traitées.

Cette couche est conçue pour stocker des données telles que le cache clé-valeur (KV) et les informations de récupération. Le cache KV contient des résultats intermédiaires générés lors de l’inférence, qui permettent à un modèle de conserver efficacement le contexte, tandis que les données de récupération fournissent des informations externes auxquelles le modèle peut accéder lors de la génération. Ces deux types de données doivent être disponibles avec une latence très faible pour que les applications d’IA puissent offrir des performances constantes.

Le secteur commence à formaliser cette architecture. Nvidia désigne cette approche sous le nom de CMX, tandis que des fournisseurs de solutions de stockage, dont Solidigm, développent des SSD spécialement optimisés pour les charges de travail d’inférence à forte intensité contextuelle. Plutôt que de considérer le stockage comme une simple destination pour les données, les responsables de la planification des infrastructures traitent de plus en plus le stockage contextuel comme une couche opérationnelle à part entière, dotée d’exigences de performances spécifiques.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, estime que cette évolution est motivée par les exigences des charges de travail plutôt que par la stratégie produit d’un fournisseur en particulier. Il souligne que la croissance rapide dans le domaine de l’inférence exerce une pression suffisante pour voir émerger une toute nouvelle catégorie d’infrastructures. À l’instar des technologies de stockage précédentes, cette catégorie devrait développer son propre écosystème logiciel, ses propres normes opérationnelles et ses propres pratiques de déploiement.

Ace Stryker, directeur du marketing IA et écosystème chez Solidigm, affirme que les organisations qui conçoivent de nouveaux centres de données dédiés à l’IA ne peuvent plus partir du principe que le stockage se limite à deux emplacements. Selon M. Stryker, le stockage doit désormais s’étendre sur au moins trois couches afin de répondre aux besoins croissants en matière de mémoire contextuelle, et il s’attend à ce que cette structure fasse désormais partie intégrante de l’infrastructure IA des entreprises.

Pour les dirigeants, cela modifie la planification à long terme des infrastructures. La décision ne se limite plus au choix des GPU et à l’augmentation de la capacité de stockage. Les entreprises doivent déterminer où résidera le contexte d’inférence persistant, à quelle vitesse il sera accessible et dans quelle mesure cette couche s’intégrera efficacement au reste de la plateforme d’IA. Les entreprises qui en tiennent compte dès à présent sont susceptibles d’optimiser l’utilisation de leur infrastructure, à mesure que les charges de travail d’IA deviennent de plus en plus persistantes et dépendantes de l’état.

Un stockage inefficace du contexte entraîne des recalculs inutiles au niveau du GPU, ce qui réduit l’efficacité globale du système

De nombreuses organisations évaluent leur infrastructure d’IA en fonction du taux d’utilisation des GPU. Cet indicateur reste certes important, mais le taux d’utilisation à lui seul ne permet pas de déterminer si ces GPU effectuent un travail utile. Si le système de stockage ne parvient pas à fournir les données de contexte assez rapidement, de précieuses ressources de calcul sont mobilisées pour recréer des informations au lieu de générer de nouveaux résultats.

Ce problème survient lors de la phase de pré-remplissage de l’inférence, lorsque le modèle traite l’ensemble du contexte pertinent avant de générer une sortie. Si le cache KV requis n’est pas disponible dans une couche de stockage rapide, le modèle régénère ce contexte. Il en résulte une activité supplémentaire du GPU sans aucune amélioration de la qualité de la réponse finale. Le système consomme davantage d’énergie, augmente la latence et réduit le débit global tout en fournissant le même résultat opérationnel.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, explique qu’une part non négligeable des cycles des GPU peut être consacrée à ce processus répété de préremplissage. Son observation remet en question la planification des infrastructures. Le problème ne réside pas toujours dans une capacité de calcul insuffisante. Dans de nombreux cas, la cause sous-jacente est que le stockage ne parvient pas à fournir suffisamment rapidement le contexte généré précédemment pour que les GPU puissent l’utiliser efficacement.

Cela incite les organisations à évaluer différemment leur infrastructure d’IA. Plutôt que de se concentrer uniquement sur le nombre de jetons générés par dollar, l’attention se porte désormais sur le « goodput », qui mesure le rendement utile par dollar après prise en compte des ressources de calcul gaspillées. Le goodput offre une vision plus concrète de l’efficacité de l’infrastructure, car il permet de déterminer si les ressources de calcul coûteuses génèrent une nouvelle valeur ajoutée pour l’entreprise, plutôt que de se contenter de reproduire des tâches déjà effectuées.

Pour les dirigeants d’entreprise, cela a des implications financières directes. Les GPU comptent parmi les composants les plus coûteux des infrastructures d’IA modernes. Chaque cycle consacré à la reconstruction du contexte existant augmente les coûts d’exploitation sans pour autant accroître la productivité. L’amélioration du stockage du contexte réduit les recalculs inutiles, raccourcit les temps de réponse et permet aux organisations de tirer davantage de valeur des ressources de calcul dont elles disposent déjà. Dans de nombreux environnements, l’amélioration de l’efficacité du stockage peut générer un meilleur retour sur investissement que la simple augmentation de la capacité des GPU.

Le stockage devient un élément stratégique de l’infrastructure de l’IA, plutôt qu’un simple actif banalisé

Le stockage a traditionnellement fait l’objet d’une attention bien moindre que le calcul. Les entreprises choisissaient souvent leurs solutions de stockage en se basant principalement sur la capacité et le coût par gigaoctet, car cela ne représentait qu’une part relativement faible de leurs dépenses globales en infrastructure. Cette approche perd de son efficacité à mesure que les charges de travail d’inférence IA dépendent de plus en plus d’un accès rapide et fiable à un contexte persistant.

Les systèmes d’IA modernes nécessitent un stockage qui contribue activement aux performances des applications. Si le stockage n’est pas en mesure de fournir des données contextuelles de manière cohérente et avec une faible latence, les GPU restent sous-utilisés, les temps de réponse s’allongent et les coûts d’infrastructure augmentent. Le stockage n’est plus simplement le lieu où sont conservées les données. Il devient un maillon actif du pipeline d’inférence.

Ace Stryker, directeur du marketing IA et écosystème chez Solidigm, affirme que cela modifie la manière dont les entreprises doivent envisager leurs investissements en infrastructure. Selon M. Stryker, la qualité du stockage a désormais un impact direct sur le retour sur investissement, car de mauvaises performances de stockage peuvent réduire l’efficacité d’un matériel d’IA coûteux. Les décisions en matière d’infrastructure, qui se concentraient autrefois presque exclusivement sur la puissance de calcul, doivent désormais inclure une évaluation minutieuse des performances de stockage.

Un autre aspect important à prendre en compte est l’optimisation de l’utilisation de la mémoire. La mémoire à large bande passante (HBM) et la DRAM offrent d’excellentes performances, mais elles sont coûteuses et leur capacité est limitée. Développer indéfiniment ces technologies de mémoire n’est ni pratique ni rentable pour de nombreux déploiements en entreprise. Une couche contextuelle dédiée, basée sur des SSD, fournit une capacité supplémentaire pour l’état d’inférence tout en réduisant la dépendance vis-à-vis de ressources mémoire plus coûteuses.

M. Stryker souligne également que le fait de suivre l’architecture recommandée par Nvidia pour de nombreux cas d’utilisation en inférence permet aux entreprises de s’appuyer davantage sur les SSD plutôt que d’augmenter la capacité de la DRAM. Cela peut réduire les investissements en infrastructure tout en continuant à prendre en charge des charges de travail d’inférence hautement performantes.

Pour les équipes de direction, le message général est clair. L’infrastructure d’IA ne doit plus être évaluée comme un ensemble de composants matériels isolés. La puissance de calcul, la mémoire, le réseau et le stockage doivent être optimisés de manière globale. Les entreprises qui continuent à considérer le stockage comme un simple produit de base risquent de limiter les performances de leurs investissements les plus précieux en matière d’IA.

Les SSD prenant en charge l’inférence IA doivent offrir une latence prévisible, une densité élevée et une intégration réseau robuste

Les solutions de stockage hautes performances ne sont pas toutes aussi adaptées à l’inférence IA. Les tests de performance traditionnels mettent souvent l’accent sur le débit maximal ou la latence moyenne. Les charges de travail d’inférence requièrent toutefois un ensemble de priorités différent, la cohérence devenant l’une des caractéristiques de performance les plus importantes.

Les systèmes d’inférence IA dépendent de temps de réponse prévisibles, car les logiciels d’orchestration répartissent en permanence les charges de travail entre les GPU et les ressources de stockage. Si le stockage subit occasionnellement des délais importants, même lorsque les performances moyennes semblent élevées, ces délais peuvent perturber la planification des charges de travail et réduire l’efficacité globale du système. C’est pourquoi la latence de queue, c’est-à-dire les temps de réponse les plus lents observés en condition de charge, est devenue un indicateur essentiel pour les infrastructures d’inférence.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, souligne que des performances de stockage fiables et mesurables sont désormais plus importantes que le simple transfert du plus grand volume de données possible. Les charges de travail d’entraînement privilégiaient un débit de pointe. Les charges de travail d’inférence privilégient quant à elles la cohérence, car une latence stable permet une allocation plus efficace des ressources à l’échelle de l’ensemble du système d’IA.

L’échelle modifie également la donne en matière de stockage. Les déploiements d’IA à grande échelle sont de plus en plus limités par la disponibilité en énergie, tout autant que par le coût du matériel. À mesure que les centres de données continuent de s’étendre, la densité de stockage et l’efficacité énergétique deviennent des enjeux opérationnels majeurs. Des indicateurs tels que le nombre de watts par pétaoctet prennent de plus en plus d’importance, car ils influent directement sur la quantité d’infrastructure d’IA pouvant être déployée dans le cadre des budgets énergétiques existants.

Les architectures d’inférence modernes s’appuient également sur des technologies réseau avancées qui permettent de maintenir l’accessibilité des ressources de stockage avec une latence minimale. Des technologies telles que NVMe over Fabrics et l’accès direct à la mémoire à distance (RDMA) favorisent une communication plus rapide entre les ressources de calcul et de stockage, tandis que la prise en charge future du Compute Express Link (CXL) devrait encore améliorer le partage de mémoire et l’utilisation des ressources au sein des systèmes d’IA.

Pour les dirigeants d’entreprise, ces capacités techniques se traduisent par des résultats commerciaux mesurables. Un système de stockage offrant des performances prévisibles améliore l’utilisation des GPU, garantit une réactivité plus constante des applications et simplifie l’exploitation de l’infrastructure. À mesure que les déploiements d’IA continuent de se développer, le choix d’un système de stockage fondé sur des performances opérationnelles durables plutôt que sur des résultats de tests de performance de pointe constituera un avantage concurrentiel de plus en plus important.

Les organisations doivent planifier de manière proactive la transition vers un niveau de mémoire contextuel

L’infrastructure de l’IA entre dans une phase où les choix architecturaux auront des conséquences à long terme. Les normes, les interfaces logicielles, les modèles de déploiement et les pratiques opérationnelles relatives à la mémoire contextuelle sont encore en cours d’élaboration. Les organisations qui commencent à planifier dès maintenant seront mieux placées pour faire évoluer efficacement leurs systèmes d’IA à mesure que ces technologies arriveront à maturité.

Cette transition ne se limite pas au simple déploiement de nouveau matériel. Elle exige également des équipes chargées de l’infrastructure qu’elles repensent la manière dont les applications d’IA sont conçues, surveillées et gérées. Le contexte persistant devient une exigence opérationnelle fondamentale pour l’IA d’entreprise, en particulier à mesure que les organisations déploient des agents capables de gérer des flux de travail complexes sur de longues périodes. Cela signifie que l’architecture de stockage, les logiciels d’orchestration, la mise en réseau et la gestion de la mémoire doivent fonctionner ensemble comme un système intégré.

Jeff Harthorn, responsable de la recherche appliquée en IA chez Solidigm, estime que la prochaine grande question pour le secteur n’est pas de savoir si les entreprises ont besoin de davantage de puissance de calcul. Il faudrait plutôt se concentrer sur une utilisation plus efficace de la puissance de calcul existante. Une meilleure gestion du contexte permet aux GPU de consacrer davantage de temps à générer des résultats utiles et moins de temps à recréer des informations qui existent déjà. À mesure que l’adoption de l’IA s’accélère, l’amélioration de l’efficacité pourrait apporter une valeur ajoutée plus importante à l’entreprise que le simple fait d’augmenter la capacité matérielle.

Solidigm participe aux travaux de normalisation du secteur, à des collaborations de recherche et à des initiatives menées avec ses partenaires qui contribuent à définir le mode de fonctionnement de cette nouvelle couche d’infrastructure. Cette dynamique s’étend à l’ensemble du secteur. Les fournisseurs d’infrastructures, les fournisseurs de cloud à très grande échelle, les développeurs de plateformes d’IA et les entreprises clientes façonnent collectivement les normes qui prendront en charge les futures charges de travail d’inférence.

Pour les dirigeants, il s’agit là d’une occasion de voir au-delà des besoins de déploiement actuels. Les investissements dans les infrastructures d’IA devraient s’inscrire dans la durée, ce qui fait de la flexibilité architecturale un critère essentiel. Prévoir dès aujourd’hui un niveau dédié à la mémoire contextuelle peut réduire les coûts de migration futurs, améliorer l’utilisation de l’infrastructure et prendre en charge des applications d’IA de plus en plus sophistiquées sans nécessiter d’augmentation proportionnelle des ressources de calcul.

Les organisations doivent également prendre conscience que la planification des infrastructures d’IA revêt désormais un caractère davantage stratégique que tactique. Les décisions relatives à l’architecture de stockage ont désormais une incidence sur l’efficacité opérationnelle, les performances des applications, les capacités de gouvernance et l’évolutivité à long terme. Les entreprises qui intègrent dès le début la « mémoire contextuelle » dans leurs feuilles de route en matière d’infrastructure seront mieux préparées à prendre en charge la prochaine génération d’IA d’entreprise, tout en maximisant la valeur de leurs investissements technologiques existants.

Récapitulation

L’IA d’entreprise entre dans une nouvelle phase. Le débat ne porte plus uniquement sur l’ajout de nouveaux GPU ou le déploiement de modèles plus volumineux. Ces investissements restent certes importants, mais ils ne suffisent plus à générer la prochaine vague de performances et d’efficacité.

À mesure que les systèmes d’IA gagnent en autonomie, en persistance et s’intègrent davantage aux processus métier clés, le contexte devient une ressource infrastructurelle essentielle. Les organisations capables de stocker, d’extraire et de gérer efficacement le contexte pourront tirer davantage de valeur de leurs investissements informatiques existants tout en prenant en charge des applications d’IA plus performantes. Celles qui continuent de s’appuyer sur des architectures conçues principalement pour l’entraînement des modèles risquent de voir leurs coûts d’infrastructure augmenter plus rapidement que la valeur ajoutée pour l’entreprise.

C’est également l’occasion de repenser la manière dont l’infrastructure d’IA est évaluée. Le succès ne doit pas être mesuré uniquement en fonction de la capacité matérielle ou des performances aux tests de référence. Il doit être évalué en fonction de l’efficacité avec laquelle l’ensemble de la plateforme fonctionne de manière coordonnée pour générer des résultats commerciaux utiles. Le stockage, la mise en réseau, la mémoire et la puissance de calcul sont de plus en plus interconnectés, et les faiblesses d’une couche peuvent limiter les performances de l’ensemble du système.

Pour les équipes de direction, la priorité est claire. La planification de l’infrastructure d’IA doit passer d’un simple approvisionnement en matériel à court terme à une stratégie architecturale à long terme. Les décisions prises aujourd’hui en matière de stockage, de gestion du contexte et de transfert des données auront une incidence sur l’évolutivité, les coûts d’exploitation, la gouvernance et la capacité à prendre en charge des charges de travail d’IA de plus en plus sophistiquées au cours des prochaines années.

Les organisations qui prendront les devants ne seront pas nécessairement celles qui disposent de la plus grande puissance de calcul. Ce seront celles qui mettront en place une infrastructure capable d’exploiter chaque ressource de manière plus efficace. À mesure que l’IA continuera d’évoluer, cette efficacité deviendra l’un des avantages concurrentiels les plus importants qu’une entreprise puisse se forger.

Alexander Procter

juillet 31, 2026

22 Min

Experts Okoone
PARLONS-EN !

Un projet en tête ?
Planifiez un appel de 30 minutes avec nous.

Des experts senior pour vous aider à avancer plus vite : produit, tech, cloud & IA.

Veuillez saisir une adresse email professionnelle valide.