Ops4AI permet aux centres de données IA haute performance d'accélérer la création de valeur tout en réduisant considérablement les coûts d'exploitation et de maintenance ainsi que les interruptions de service.
En janvier 2024, Réseau Junipers a lancé sonPlateforme de réseau native IA, qui exploite les données pertinentes et l'infrastructure adéquate pour fournir la réponse appropriée et garantir une expérience utilisateur et une expérience optimales pour les équipes d'exploitation. En utilisant l'IA pour simplifier les opérations réseau (IA pour les réseaux) et en utilisant des matrices de commutation Ethernet optimisées par l'IA pour améliorer les charges de travail d'IA et les performances des GPU (Réseaux pour l'IA), Juniper respecte son engagement indéfectible de fournir à ses clients un réseau axé sur l'expérience.
Avec une longue expérience dans la fourniture d'infrastructures de centres de données performantes et sécurisées, notamment les commutateurs QFX, les routeurs PTX et les SRX Pare-feus,Réseaux Juniper est fier d'annoncer la disponibilité de une extension de notre Architecture de réseau native de l'intelligence artificielleCette solution permet aux clients de déployer des datacenters entièrement optimisés par l'IA et fonctionnant avec des fournisseurs multiples. La nouvelle solution Ops4AI offre des améliorations significatives pour apporter une valeur ajoutée encore plus importante aux clients.
Ops4AI comprend une combinaison unique des composants Juniper suivants :
- AIOps des centres de données construit sur l'assistant de réseau virtuel Marvis ;
- Automatisation basée sur l'intention via la gestion de la matrice de commutation multi-fournisseurs de centres de données Juniper Apstra ;
- Fonctionnalités Ethernet optimisées par l'IA, y compris RoCEv2 pour IPv4/v6, la gestion de la congestion, l'équilibrage de charge efficace et la télémétrie.
En intégrant ces composants, Ops4AI permet aux centres de données IA haute performance d'accélérer la création de valeur tout en réduisant les coûts d'exploitation et de maintenance et en rationalisant les processus.La solution est désormais encore meilleure grâce à plusieurs améliorations : un nouveau laboratoire multi-fournisseurs Juniper Ops4AI ouvert aux clients pour tests de modèles et de charges de travail d'IA open source et privés; des conceptions validées par Juniper intégrant des technologies de Juniper, Nvidia, Broadcom, Intel, Weka et d'autres partenaires pour garantir la mise en réseau des applications d'IA ; et des conceptions optimisées pour l'IA qui garantir la mise en réseau de l'IA; et Améliorations logicielles Junos et Apstra pour les réseaux de centres de données optimisés par l'IA - le sujet principal de cet article de blog.
Examinons les nouvelles améliorations apportées aux logiciels Junos® et Juniper Apstra. Ces fonctionnalités incluent :
Réglage automatique de la matrice de commutation IA
L'accès dynamique à la mémoire à distance (RDMA) pour les GPU génère un trafic réseau important dans les réseaux d'IA. Malgré l'utilisation de diverses techniques d'évitement de la congestion, telles que l'équilibrage de charge, la congestion persiste (par exemple, le transfert de données de plusieurs GPU vers le même GPU lors du dernier changement de point de saut peut provoquer une congestion).
Lorsque cela se produit, les clients peuvent utiliser des techniques de contrôle de la congestion telles que la notification quantitative de congestion des centres de données (DCQCN), qui utilise plusieurs fonctionnalités telles que la notification explicite de congestion (ECN) et le contrôle de flux basé sur la priorité (PFC) pour calculer et configurer les paramètres afin d'obtenir des performances optimales sur chaque file d'attente sur chaque port à travers tous les commutateurs. Configurer manuellement ces paramètres pour des milliers de files d'attente sur tous les commutateurs est difficile et fastidieux.
Pour relever ce défi, Apstra collecte périodiquement des données de télémétrie de chaque file d'attente sur chaque port. Ces données de télémétrie servent à calculer les paramètres ECN et PFC optimaux pour chaque file d'attente sur chaque port. Grâce à l'automatisation en boucle fermée, ces paramètres optimaux peuvent être configurés sur tous les commutateurs du réseau.
Cette solution offre des paramètres de contrôle de congestion optimaux qui simplifient considérablement les opérations et la maintenance, réduisent la latence et raccourcissent le temps d'exécution des tâches (JCT). Nos clients ont investi massivement dans leur infrastructure d'IA, ce qui nous permet de proposer gratuitement ces fonctionnalités dans Juniper Apstra. Visionnez la dernière démonstration du Cloud Field Day pour en savoir plus sur leur fonctionnement. Cette application est également disponible sur GitHub.
Équilibrage de charge global
Le trafic réseau lié à l'IA présente des caractéristiques uniques. Ces flux sont principalement générés par le trafic RDMA produit par les GPU, ce qui entraîne une forte consommation de bande passante et un nombre réduit de flux individuellement volumineux (souvent appelés « flux éléphants »). Par conséquent, l'équilibrage de charge statique basé sur le hachage quintuple est inefficace. Plusieurs « flux d'éléphants » convergent vers la même liaison et provoquent des embouteillages. Cela entraîne des JCT plus longs, ce qui peut perturber considérablement les investissements importants dans les GPU.
La solution à ce problème est L'équilibrage dynamique de charge (DLB), qui prend en compte l'état de la liaison montante sur le commutateur local.
Le DLB peut augmenter considérablement l'utilisation de la bande passante de la matrice de commutation. par rapport à l'équilibrage de charge statique traditionnel . Cependant, DLB présente des limitations, dont l'une est qu'il ne suit que la qualité de la liaison locale, au lieu de connaître la qualité du chemin complet entre le nœud d'entrée et le nœud de sortie.
Supposons que nous ayons une topologie CLOS où le serveur 1 et le serveur 2 tentent d'envoyer des flux de données nommés respectivement flow-1 et flow-2. Si DLB est utilisé, le commutateur leaf-1 ne connaît que l'utilisation de la liaison locale et prend des décisions uniquement en fonction de la table de qualité du commutateur local ; la liaison locale peut donc être en parfait état.Cependant, si GLB est utilisé, la qualité de l'ensemble du chemin est connue, y compris les problèmes de congestion qui surviennent dans la hiérarchie tronc-feuille.
C'est similaire à Google Maps, où l'itinéraire sélectionné est basé sur une vue d'ensemble.
Cela sélectionne le meilleur chemin réseau et offre une latence plus faible, une utilisation du réseau plus élevée et des JCT plus rapides, ce qui, du point de vue de la charge de travail IA, conduit à de meilleures performances de la charge de travail IA et rend les GPU coûteux plus efficaces.
Visibilité de bout en bout du réseau à la carte réseau intelligente (SmartNIC).
Aujourd'hui, les administrateurs peuvent découvrir où se produisent les congestions simplement en regardant Commutateur réseauCependant, il leur est impossible de déterminer quels points de terminaison (ou GPU, dans le cas d'un centre de données dédié à l'IA) sont affectés par la congestion. Cela complique l'identification et la résolution des problèmes de performance. Dans un environnement d'entraînement multiple, il est impossible de déterminer quelles tâches sont ralenties par la congestion en se basant uniquement sur les données de télémétrie des commutateurs, sans vérifier manuellement les statistiques NIC RoCE v2 sur tous les serveurs. Or, une telle vérification manuelle est extrêmement difficile à mettre en œuvre.
Pour résoudre ce problème, les données de télémétrie en continu RoCE v2 riches provenant du serveur d'IA SmartNIC peuvent être intégrées à Juniper Apstra et corrélées aux données de télémétrie du commutateur réseau existant afin d'augmenter considérablement la capacité d'observer et de déboguer les flux de travail en cas de problèmes de performance.
Cette corrélation offre une vision plus complète du réseau, permettant de mieux comprendre la relation entre les serveurs d'IA et le comportement du réseau. Les données en temps réel fournissent des informations sur les performances du réseau, les modèles de trafic, les points de congestion potentiels et les terminaux affectés, contribuant ainsi à identifier les goulots d'étranglement et les anomalies de performance.
Cette fonctionnalité améliore la surveillance du réseau, simplifie le débogage des problèmes de performance et contribue à optimiser les performances globales du réseau grâce à des actions en boucle fermée. Par exemple, la surveillance des paquets corrompus dans la carte réseau intelligente (SmartNIC) permet d'ajuster les paramètres de la fonction d'équilibrage de charge intelligent du commutateur. Ainsi, la visibilité de bout en bout permet aux utilisateurs d'exploiter leur infrastructure d'IA à son plein potentiel.












