Notification de perte de paquets et de congestion : une approche plus intelligente, plus rapide et synchronisée pour accélérer l’exécution de vos tâches d’IA.
Portée par les progrès technologiques dans l'apprentissage automatique, le traitement du langage naturel, l'IA générative, la robotique et les systèmes autonomes, l'intelligence artificielle (IA) et le calcul haute performance (HPC) connaissent une croissance significative.
Au cœur de ces innovations se trouvent des modèles d'entraînement distribués à grande échelle, comprenant généralement des milliards, voire des billions de paramètres répartis sur plusieurs GPU. Durant l'entraînement, ces nœuds se synchronisent en échangeant d'énormes quantités de données et des mises à jour en temps réel via un réseau de commutation Ethernet dédié à l'IA. Cependant, la perte de paquets compromet fortement cette synchronisation, entraînant des retransmissions ou des blocages de communication. Il en résulte une latence accrue, des temps d'exécution des tâches (JCT) allongés et une utilisation inefficace des ressources GPU, pourtant coûteuses.
Perte de paquets silencieuse dans les matrices de commutation des centres de données d'IA
Le JCT constitue un indicateur essentiel, tandis que les charges de travail modernes d'IA — notamment les tâches d'entraînement et d'inférence à grande échelle — reposent sur une synchronisation étroite entre les clusters. La perte d'un seul paquet peut impacter significativement les performances et augmenter les coûts opérationnels.
Par exemple, en cas de saturation des tampons de commutation due à une congestion du trafic, les paquets RoCE v2 peuvent subir des pertes au sein de l'infrastructure de commutation Ethernet/IP de l'IA. Ces paquets rejetés doivent être retransmis, ce qui entraîne une latence et des interruptions dans les processus d'entraînement ou d'inférence.
Bien que la notification explicite de congestion (ECN) signale la congestion en marquant des bits dans l'en-tête IP, elle ne permet pas d'identifier les paquets spécifiques qui ont été rejetés en raison de cette congestion. Par conséquent, elle ne peut déterminer quels paquets nécessitent une retransmission.
Solution de notification de perte de paquets et de congestion (DCN)
Pour remédier à ce problème, Réseau Junipers a introduit Drop Congestion Notification (DCN), une nouvelle fonctionnalité de gestion de la congestion développée pour la version logicielle Junos OS(TM) Evolved 23.4x100d40 sur les QFX5240-OD et QFX5240-QD (plateformes Ethernet/IP 64 x 800GbE) basées sur la puce Tomahawk 5.
En cas de congestion, le commutateur transmet des notifications de perte de paquets en réduisant la taille des paquets et en acheminant ces informations vers les hôtes destinataires via des files d'attente prioritaires. Les commutateurs de transit au sein du Commutateur réseauLe tissu de traitement identifie ces paquets découpés portant des marqueurs DCN et les dirige vers des files d'attente prioritaires.
Par conséquent, l'hôte de destination doit traiter ces paquets DCN tronqués, déterminer quels paquets ont été explicitement rejetés en raison de la congestion et demander immédiatement la retransmission des paquets perdus à la source.
Cependant, ces paquets élagués ne sont pas envoyés à la mémoire du serveur cible. Ils servent plutôt à identifier précisément les paquets nécessitant une retransmission sélective. Ceci permet d'éviter que le processus de retransmission par défaut ne devienne excessivement long, ce qui réduit la latence de bout en bout et garantit la bonne exécution des tâches.
Le schéma ci-dessous illustre une topologie simplifiée : lorsque des paquets arrivent au niveau du premier commutateur, en cas de congestion extrême (dépassement du seuil ECN), ces paquets ne sont pas rejetés mais élagués avant d’être envoyés à la carte réseau du serveur GPU cible. Bien que l’élagage soit effectué par le premier commutateur, les commutateurs intermédiaires peuvent également reconnaître les trames élaguées et les envoyer immédiatement à l’interface de sortie via une file d’attente prioritaire. À leur arrivée sur la carte réseau cible, le système initie une requête de retransmission vers le serveur source.
Sur les commutateurs QFX5240-OD et QFX5240-QD, une file d'attente dédiée, indépendante de la file d'attente de paquets, gère les paquets DCN. Cette séparation permet une gestion plus efficace de la latence et de la bande passante allouées aux paquets DCN.

Au sein d'une infrastructure de commutation Ethernet IA, il est primordial de maintenir des performances constantes et un fonctionnement synchronisé, notamment lorsque les charges de travail s'étendent sur des clusters GPU distribués. DCN relève ce défi critique en offrant une visibilité en temps réel sur les pertes de paquets lors de fortes congestions. En alertant les terminaux en cas de perte de paquets, DCN permet une récupération plus rapide, minimise la latence cachée et contribue au maintien de la connectivité réseau IA (AI JCT).
En définitive, DCN comble le fossé de visibilité entre l'infrastructure de commutation réseau et les charges de travail d'IA, s'imposant comme une capacité fondamentale pour la construction d'une infrastructure d'IA évolutive et performante.












