Ces deux dernières années ont bouleversé la réalité des coûts liés à l'IA d'entreprise. Pas en théorie, mais dans la pratique, lors des appels d'offres concrets, lorsque les entreprises tentent de passer d'une validation de principe à un déploiement en production.
Au début du mois, l'une de nos équipes de développement, alors qu'elle travaillait à la mise en place d'une plateforme RAG d'entreprise, a tenté de faire évoluer un pipeline RAG sur une infrastructure cloud standard existante, mais s'est rapidement heurtée à des limites d'allocation de GPU. Cela nous amène à nous pencher sur l'utilisation croissante de Nerocloud dans les infrastructures d'IA d'entreprise.
La demande en matière d'IA est évidente. Des applications de type ChatGPT et des agents IA d'entreprise aux systèmes RAG, en passant par le réglage fin des modèles et la vision par ordinateur à grande échelle, les entreprises investissent massivement dans les capacités d'IA. Le plus grand défi se présente souvent en coulisses. À mesure que ces charges de travail passent de la phase d'expérimentation à la production, de nombreuses équipes se trouvent confrontées à des pénuries de GPU, à de longs délais de provisionnement et à des coûts de cloud computing qui ne cessent d'augmenter. La mise en œuvre de l'IA à grande échelle ne se limite plus à la création de modèles : il s'agit désormais de mettre en place l'infrastructure nécessaire pour les faire fonctionner efficacement.
AWS, Azure et Google Cloud n'ont pas été conçus pour cela. Ils ont été conçus pour tout, ce qui signifie qu'ils n'ont été optimisés pour rien en particulier. Une nouvelle catégorie de fournisseurs a vu le jour pour combler cette lacune. On les appelle les « NeoClouds », et ils figurent de plus en plus souvent parmi les finalistes dans les appels d'offres pour les infrastructures d'entreprise.
Qu'est-ce que les NeoClouds ?
NeoCloud est un fournisseur de services cloud dont l'activité repose entièrement sur le calcul GPU pour l'IA et les charges de travail hautes performances. Il ne s'agit pas d'une gamme de produits au sein d'une plateforme plus large, mais bien de l'entreprise dans son ensemble.
Ils se concentrent principalement sur :
- Entraînement des modèles d'IA
- Inférence IA à grande échelle
- Gestion de l'infrastructure GPU
- Déploiement de grands modèles linguistiques
- Applications d'IA générative
Contrairement aux hyperscalers, qui prennent en charge toutes les charges de travail imaginables et considèrent la location de GPU comme une référence parmi des milliers d'autres, les NeoClouds sont spécialement conçus pour l'IA. Cette différence se reflète à tous les niveaux de la pile.
Caractéristiques principales :
- Infrastructure axée sur le GPU – ici, on donne la priorité au matériel le plus récent, et non pas à celui qui est mis de côté
- Réseautage optimisé par l'IA – Les interconnexions InfiniBand et à haut débit sont fournies de série et ne constituent pas des options supplémentaires
- Stockage haute performance – conçu pour alimenter les clusters de GPU, et non pour répondre aux besoins généraux en matière de stockage d'objets
- Un accès plus rapide aux derniers processeurs graphiques – les fournisseurs se font concurrence sur la modernité de leur matériel ; c'est leur principal argument de vente
- Équipes d'assistance spécialisées dans l'IA – des ingénieurs qui maîtrisent la formation distribuée, les modèles vLLM et les pannes multi-GPU, et non pas simplement la gestion des tickets dans le cloud
Pourquoi les NeoClouds font leur apparition
La cause immédiate est simple : la demande en puissance de calcul pour l'IA a dépassé ce que les hyperscalers sont en mesure de fournir.
Les charges de travail à l'origine de cette demande comprennent :
- Assistants de type ChatGPT et copilotes d'entreprise
- Systèmes RAG interrogation de vastes bases de données documentaires internes
- Réglage fin du modèle à partir de données propriétaires
- Agents IA d'entreprise exécution de flux de travail en plusieurs étapes
- Les systèmes de vision par ordinateur dans le commerce de détail, la logistique et l'industrie manufacturière
La construction de nouveaux centres de données hyperscale prend entre trois et cinq ans. Le déploiement de l'IA se mesure en trimestres. Cet écart ne se comble pas rapidement.
De ce fait, les entreprises qui gèrent des charges de travail importantes liées à l'IA sont régulièrement confrontées à :
- Des délais d'approvisionnement longs – les demandes de quotas, les listes d'attente et les contraintes de capacité concernant les GPU dont ils ont réellement besoin
- Coûts imprévisibles – Les tarifs des GPU à la demande, conçus pour des pics de calcul de courte durée, ne sont pas adaptés à des charges de travail soutenues en matière d'apprentissage ou d'inférence
- Disponibilité limitée – certaines familles de GPU, en particulier les dernières générations, ne sont souvent pas disponibles à grande échelle via les canaux de cloud computing classiques
- Complexité opérationnelle – Les plateformes polyvalentes nécessitent un travail d'ingénierie considérable pour être configurées en vue de prendre en charge des modèles de réseau et de stockage spécifiques à l'IA
Les NeoClouds existent parce que ces problèmes sont structurels, et non pas temporaires.
NeoClouds face aux fournisseurs de cloud traditionnels
| Fonctionnalité | Cloud traditionnel (AWS, Azure, GCP) | NeoClouds |
|---|---|---|
| Objectif principal | Charges de travail générales dans le cloud | Charges de travail liées à l'IA et aux GPU |
| Disponibilité des GPU | Partagé entre les services | Priorité au GPU |
| Vitesse de déploiement | Modéré | Plus rapide pour les charges de travail liées à l'IA |
| Expertise en IA | Assistance générale pour le cloud | Équipes spécialisées en IA |
| Modèle de coûts | Une large gamme de tarifs pour l'ensemble des services | Tarification axée sur l'IA, par GPU |
| Actualité du matériel | Répartition équilibrée entre les gammes de produits | Priorité aux GPU les plus récents |
| Options nationales / régionales | Disponible uniquement sur certains marchés | En pleine expansion, notamment au Royaume-Uni et en Europe |
Le point essentiel n'est pas que les NeoClouds soient meilleurs que les hyperscalers. C'est qu'ils sont optimisés pour des tâches différentes. Pour l'hébergement d'applications générales, les pipelines de données ou les infrastructures SaaS, les hyperscalers restent le choix par défaut le plus judicieux. En revanche, pour les charges de travail d'IA soutenues et gourmandes en ressources GPU, le calcul s'avère souvent différent.
Avantages de NeoClouds
Accès plus rapide au GPU
Les entreprises peuvent se procurer des GPU haute performance sans devoir passer par des systèmes de quotas ni attendre une capacité qui pourrait ne pas être disponible dans la région dont elles ont besoin. Pour les équipes qui ont un modèle à entraîner ou un produit à commercialiser, ce gain de temps est considérable.
Infrastructure optimisée pour l'IA
Cette infrastructure a été spécialement conçue pour :
- Entraînement de modèles à grande échelle sur des clusters multi-GPU
- Service d'inférence à faible latence
- Affiner des modèles open source à l'aide d'ensembles de données propriétaires
- Formation distribuée nécessitant une communication rapide entre les GPU
Exécuter des charges de travail d'IA sur une infrastructure conçue pour le calcul général revient à s'adapter à des contraintes qui ne devraient pas exister.
Une meilleure rentabilité pour les charges de travail soutenues
De nombreuses entreprises estiment que NeoClouds est nettement plus rentable que les tarifs à la demande des hyperscalers pour les charges de travail fonctionnant en continu. Les économies réalisées dépendent de l'adéquation entre les structures d'engagement et les habitudes d'utilisation réelles : c'est le taux d'utilisation des GPU qui compte, et non le tarif horaire affiché.
Prise en charge native de l'IA
Des équipes d'assistance qui maîtrisent les problèmes concrets liés à l'entraînement distribué : pourquoi une tâche se bloque à 98%, comment optimiser vLLM pour privilégier le débit ou la latence, et quelle topologie InfiniBand influe sur le parallélisme des modèles. Ce type d'expertise est rarement disponible via les canaux d'assistance cloud classiques.
Types de fournisseurs NeoCloud
NeoClouds à consommation énergétique optimisée
Exemples : Crusoe, IREN
Axé sur les infrastructures d'IA durables implantées à proximité de sources d'énergie renouvelables ou inexploitées. Convient aux organisations ayant pris des engagements en matière de réduction des émissions de carbone ou soumises à des obligations de reporting ESG.
NeoClouds : une solution conçue pour les développeurs
Exemples : DigitalOcean, Hot Aisle
Conçu pour un déploiement rapide et pour optimiser la productivité des développeurs. Des cycles de mise en service plus courts, des API plus épurées et une tarification simple. Plus adapté aux équipes qui déploient rapidement des fonctionnalités d'IA qu'aux organisations qui effectuent des sessions d'entraînement à l'échelle du pétaoctet.
Fournisseurs d'IA axés sur la scalabilité
Exemples : CoreWeave, TensorWave
Conçu pour l'entraînement et l'inférence en IA à grande échelle. CoreWeave est le leader de ce secteur, avec un chiffre d'affaires annuel dépassant les 1,45 milliard de dollars, et compte parmi ses clients Microsoft, Meta et OpenAI. Ces fournisseurs opèrent à une échelle comparable à celle des hyperscalers tout en conservant une spécialisation dans les GPU.
Clouds d'IA pour les entreprises et les administrations publiques
Exemples : Core42 (Émirats arabes unis/Europe), IBM
Conçu pour la conformité, la gouvernance et les secteurs réglementés. Core42 est actuellement l'acteur le plus dynamique dans ce domaine : une entreprise soutenue par G42 qui a récemment levé 1,45 milliard de dirhams auprès de HSBC, s'est associée à Red Hat et Microsoft Azure pour une infrastructure “ souveraine par conception ”, et dessert le secteur public, la défense et les secteurs réglementés à travers les Émirats arabes unis – avec un siège européen désormais établi à Dublin. Sa plateforme de contrôles souverains, Insight, offre aux organisations réglementées des contrôles techniques et stratégiques sur la classification des données, la résidence des données et la gouvernance des charges de travail d’IA. Pour les organisations opérant au Moyen-Orient ou dans les secteurs réglementés européens, Core42 constitue une alternative de plus en plus crédible aux offres souveraines des hyperscalers. La question à laquelle elle répond n'est pas seulement “ où se trouvent les données ”, mais « qui gouverne l'ensemble du pipeline d'IA, y compris les poids des modèles, les entrées d'inférence et les pistes d'audit ».”
À qui s'adresse NeoClouds ?
Start-ups spécialisées dans l'IA
- Développer des produits natifs pour l'IA nécessitant une disponibilité constante des GPU
- Réglage fin de modèles open source (Llama, Gemma, Mistral) sur des données propriétaires
- Déploiement à grande échelle d'agents IA ou de services d'inférence
- Lorsque les tarifs des hyperscalers ne correspondent pas à la rentabilité unitaire des entreprises en phase de démarrage
Entreprises SaaS
- Intégration de fonctionnalités d'IA nécessitant une infrastructure d'inférence fiable et évolutive
- Exploitation de moteurs de recommandation ou de systèmes de personnalisation nécessitant un débit élevé
- Développer des capacités d'IA qui doivent évoluer en fonction de l'utilisation des produits, et non en fonction des cycles de quotas cloud
Entreprises
- Assistants IA internes interrogeant de vastes bases de connaissances
- Systèmes de gestion des connaissances intégrant des pipelines RAG couvrant plusieurs années de documentation
- AI-powered customer service platforms and real-time AI voice agents with strict latency requirements depend on GPU infrastructure
- Toute organisation pour laquelle la localisation des données, la conformité au RGPD britannique ou la réglementation sectorielle spécifique rendent indispensable le recours à une infrastructure GPU souveraine
L'avis de notre directeur technique :
Comme l'ont constaté de nombreux dirigeants d'entreprise, le défi actuel ne consiste plus à décider s'il faut investir dans l'IA, mais bien à mettre en place l'infrastructure cloud nécessaire pour soutenir efficacement les initiatives en matière d'IA et accompagner la croissance de l'entreprise.
Comment les NeoClouds s'intègrent dans l'architecture d'IA d'entreprise
Une pile d'IA de production reposant sur l'infrastructure NeoCloud se présente généralement comme suit :
Couche applicative
Assistants IA internes · Agents du service client · Co-pilotes commerciaux et RH · Outils de gestion des connaissances
Calque des modèles
GPT-4o (via API) · Llama 3, Gemma, DeepSeek, Qwen (en auto-hébergement) · Modèles propriétaires optimisés
Couche des frameworks
PyTorch / TensorFlow · ONNX · vLLM / Triton
Couche infrastructure
Plateforme GPU NeoCloud · Kubernetes · Réseaux InfiniBand ou RoCE haut débit · Surveillance et observabilité IA
Le NeoCloud se situe à la base de cette pile, mais il n'en est pas le seul composant. L'orchestration, la surveillance, l'intégration avec les systèmes existants et la couche applicative qui les surplombe nécessitent toutes un travail d'ingénierie distinct du choix de l'infrastructure lui-même, mais tout aussi important.
Ce que cela signifie pour les entreprises
Gartner estime que d'ici 2030, les fournisseurs de NeoCloud détiendront environ 201 milliards de dollars d'un marché du cloud IA évalué à 1 426,7 milliards de dollars. Les hyperscalers eux-mêmes – Microsoft, Meta, Google – achètent déjà de la capacité NeoCloud, car ils ne parviennent pas à construire des centres de données assez rapidement pour répondre à leur propre demande.
Pour les entreprises qui envisagent de mettre en place des initiatives d'IA, la question concrète n'est pas “ devons-nous utiliser un NeoCloud ? ”, mais “ quelles charges de travail doivent être traitées sur une infrastructure spécialisée, et de quoi notre architecture a-t-elle besoin pour prendre cela en charge ? ”
Les organisations devraient déterminer si les plateformes NeoCloud présentent des avantages dans les domaines suivants :
- Coût – coût total à des niveaux d'utilisation réalistes, et non le tarif affiché
- Performance – débit et latence sous une charge d'application réelle
- Évolutivité – une capacité capable de s'adapter à l'évolution de la charge de travail sans être limitée par des quotas
- Disponibilité des GPU – en particulier pour certaines familles de GPU requises à grande échelle
- Vitesse de déploiement de l'IA – délai entre la conception et la production
C'est au niveau de l'architecture et de l'intégration que Carmatec intervient : caractérisation des charges de travail avant la décision d'achat, orchestration et DevOps pour exécuter les charges de travail de manière portable, ainsi que l'ingénierie applicative (pipelines RAG, services d'inférence, frameworks d'agents) qui s'appuie sur la couche de calcul. L'infrastructure constitue la base. Le plus difficile est de la mettre au service d'un problème métier spécifique.
Conclusion
Les NeoClouds marquent un tournant majeur dans la manière dont les infrastructures d'IA sont fournies. À mesure que l'adoption de l'IA s'accélère, les entreprises se tourneront de plus en plus vers des plateformes spécialement conçues pour les charges de travail natives de l'IA, plutôt que vers les fournisseurs de cloud traditionnels.
Pour les entreprises qui développent des applications d'IA, des agents IA, des systèmes RAG ou des plateformes d'inférence à grande échelle, NeoClouds peut offrir une voie plus rapide et plus économique vers la mise en production que de continuer à composer avec les contraintes des infrastructures cloud polyvalentes.
Si vous êtes en train d'étudier les différentes options d'infrastructure d'IA pour votre organisation, contactez notre équipe pour évaluer vos besoins en termes de charge de travail avant de vous engager auprès d'un prestataire.