AWS y NVIDIA colaboran en una infraestructura de última generación
Amazon Web Services, Inc. (AWS), una empresa de Amazon.com, Inc. (NASDAQ: AMZN) y NVIDIA (NASDAQ: NVDA) anunciaron hoy una colaboración de varias partes centrada en desarrollar el software más escalable del mundo, en -Exigir una infraestructura de inteligencia artificial (IA) optimizada para entrenar modelos de lenguaje grande (LLM) cada vez más complejos y desarrollar aplicaciones de IA generativas.
El trabajo conjunto presenta instancias P5 de Amazon Elastic Compute Cloud (Amazon EC2) de próxima generación con tecnología de GPU NVIDIA H100 Tensor Core y la red y escalabilidad de última generación de AWS que ofrecerán hasta 20 exaFLOPS de rendimiento informático para la construcción y la capacitación. los modelos de aprendizaje profundo más grandes. Las instancias P5 serán las primeras instancias basadas en GPU en aprovechar la red de adaptador de tejido elástico (EFA) de segunda generación de AWS, que proporciona 3200 Gbps de rendimiento de red de ancho de banda alto y baja latencia, lo que permite a los clientes escalar hasta 20 000 GPU H100 en EC2 UltraClusters para acceso bajo demanda a rendimiento de clase supercomputadora para IA.
“AWS y NVIDIA han colaborado durante más de 12 años para ofrecer soluciones basadas en GPU rentables y a gran escala bajo demanda para diversas aplicaciones como AI/ML, gráficos, juegos y HPC”, dijo Adam Selipsky, director ejecutivo de AWS. . “AWS tiene una experiencia inigualable en la entrega de instancias basadas en GPU que han superado los límites de escalabilidad con cada generación sucesiva, con muchos clientes escalando las cargas de trabajo de capacitación de aprendizaje automático a más de 10 000 GPU en la actualidad. Con EFA de segunda generación, los clientes podrán escalar sus instancias P5 a más de 20 000 GPU NVIDIA H100, brindando capacidades de supercomputadora bajo demanda a clientes que van desde nuevas empresas hasta grandes empresas”.
“La computación acelerada y la IA han llegado, y justo a tiempo. La computación acelerada proporciona aceleraciones de funciones escalonadas al mismo tiempo que reduce los costos y la energía a medida que las empresas se esfuerzan por hacer más con menos. La IA generativa ha despertado a las empresas para que vuelvan a imaginar sus productos y modelos comerciales y sean disruptores y no disruptivos”, dijo Jensen Huang, fundador y director ejecutivo de NVIDIA. “AWS es un socio desde hace mucho tiempo y fue el primer proveedor de servicios en la nube en ofrecer GPU NVIDIA. Estamos encantados de combinar nuestra experiencia, escala y alcance para ayudar a los clientes a aprovechar la informática acelerada y la IA generativa para aprovechar las enormes oportunidades que se avecinan”.
Nuevos clústeres de supercomputación
Las nuevas instancias P5 se basan en más de una década de colaboración entre AWS y NVIDIA que ofrecen la infraestructura de IA y HPC y se basan en cuatro colaboraciones anteriores en instancias P2, P3, P3dn y P4d(e). Las instancias P5 son la quinta generación de ofertas de AWS con tecnología de GPU NVIDIA y llegan casi 13 años después de su implementación inicial de GPU NVIDIA, comenzando con las instancias CG1.
Las instancias P5 son ideales para entrenar y ejecutar inferencias para LLM cada vez más complejos y modelos de visión por computadora detrás de las aplicaciones de IA generativas más exigentes y de uso intensivo de cómputo, que incluyen respuesta a preguntas, generación de código, generación de video e imágenes, reconocimiento de voz y más.
Específicamente diseñadas tanto para empresas como para startups que compiten para llevar la innovación impulsada por IA al mercado de una manera escalable y segura, las instancias P5 cuentan con ocho GPU NVIDIA H100 capaces de 16 petaFLOP de rendimiento de precisión mixta, 640 GB de memoria de gran ancho de banda y 3200 Conectividad de red Gbps (8 veces más que la generación anterior) en una única instancia EC2. El mayor rendimiento de las instancias P5 acelera el tiempo para entrenar modelos de aprendizaje automático (ML) hasta 6 veces (lo que reduce el tiempo de entrenamiento de días a horas), y la memoria GPU adicional ayuda a los clientes a entrenar modelos más grandes y complejos. Se espera que las instancias P5 reduzcan el costo de entrenar modelos ML hasta en un 40 % con respecto a la generación anterior, lo que brindará a los clientes una mayor eficiencia en comparación con ofertas en la nube menos flexibles o sistemas locales costosos.
Las instancias P5 de Amazon EC2 se implementan en clústeres de hiperescala llamados EC2 UltraClusters que se componen del procesamiento, las redes y el almacenamiento de más alto rendimiento en la nube. Cada EC2 UltraCluster es una de las supercomputadoras más poderosas del mundo, lo que permite a los clientes ejecutar sus cargas de trabajo de HPC distribuidas y capacitación de ML de múltiples nodos más complejas. Cuentan con redes sin bloqueo a escala de petabits, con tecnología de AWS EFA, una interfaz de red para instancias de Amazon EC2 que permite a los clientes ejecutar aplicaciones que requieren altos niveles de comunicaciones entre nodos a escala en AWS. La interfaz de hardware de derivación del sistema operativo (SO) personalizado de EFA y la integración con NVIDIA GPUDirect RDMA mejoran el rendimiento de las comunicaciones entre instancias al reducir la latencia y aumentar la utilización del ancho de banda. lo cual es fundamental para escalar el entrenamiento de modelos de aprendizaje profundo en cientos de nodos P5.
Con instancias P5 y EFA, las aplicaciones de ML pueden usar la biblioteca de comunicaciones colectivas de NVIDIA (NCCL) para escalar hasta 20 000 GPU H100. Como resultado, los clientes obtienen el rendimiento de las aplicaciones de los clústeres de HPC locales con la elasticidad y flexibilidad bajo demanda de AWS. Además de estas capacidades informáticas de vanguardia, los clientes pueden utilizar la cartera de servicios más amplia y profunda de la industria, como Amazon S3 para almacenamiento de objetos, Amazon FSx para sistemas de archivos de alto rendimiento y Amazon SageMaker para crear, capacitar e implementar aprendizaje profundo. aplicaciones Las instancias P5 estarán disponibles en las próximas semanas en versión preliminar limitada. Para solicitar acceso, visite Las aplicaciones de ML pueden usar NVIDIA Collective Communications Library (NCCL) para escalar hasta 20 000 GPU H100. Como resultado, los clientes obtienen el rendimiento de las aplicaciones de los clústeres de HPC locales con la elasticidad y flexibilidad bajo demanda de AWS. Además de estas capacidades informáticas de vanguardia, los clientes pueden utilizar la cartera de servicios más amplia y profunda de la industria, como Amazon S3 para almacenamiento de objetos, Amazon FSx para sistemas de archivos de alto rendimiento y Amazon SageMaker para crear, capacitar e implementar aprendizaje profundo. aplicaciones Las instancias P5 estarán disponibles en las próximas semanas en versión preliminar limitada.
Para solicitar acceso, visite Las aplicaciones de ML pueden usar NVIDIA Collective Communications Library (NCCL) para escalar hasta 20 000 GPU H100. Como resultado, los clientes obtienen el rendimiento de las aplicaciones de los clústeres de HPC locales con la elasticidad y flexibilidad bajo demanda de AWS. Además de estas capacidades informáticas de vanguardia, los clientes pueden utilizar la cartera de servicios más amplia y profunda de la industria, como Amazon S3 para almacenamiento de objetos, Amazon FSx para sistemas de archivos de alto rendimiento y Amazon SageMaker para crear, capacitar e implementar aprendizaje profundo. aplicaciones Las instancias P5 estarán disponibles en las próximas semanas en versión preliminar limitada.
Para solicitar acceso, visite Además de estas capacidades informáticas de vanguardia, los clientes pueden utilizar la cartera de servicios más amplia y profunda de la industria, como Amazon S3 para almacenamiento de objetos, Amazon FSx para sistemas de archivos de alto rendimiento y Amazon SageMaker para crear, capacitar e implementar aprendizaje profundo. aplicaciones Las instancias P5 estarán disponibles en las próximas semanas en versión preliminar limitada. Para solicitar acceso, visite Además de estas capacidades informáticas de vanguardia, los clientes pueden utilizar la cartera de servicios más amplia y profunda de la industria, como Amazon S3 para almacenamiento de objetos, Amazon FSx para sistemas de archivos de alto rendimiento y Amazon SageMaker para crear, capacitar e implementar aprendizaje profundo. aplicaciones Las instancias P5 estarán disponibles en las próximas semanas en versión preliminar limitada.
Con las nuevas instancias EC2 P5, clientes como Anthropic, Cohere, Hugging Face, Pinterest y Stability AI podrán crear y entrenar los modelos de aprendizaje automático más grandes a escala. La colaboración a través de generaciones adicionales de instancias EC2 ayudará a las nuevas empresas, empresas e investigadores a escalar sin problemas para satisfacer sus necesidades de ML.
Anthropic construye sistemas de IA confiables, interpretables y dirigibles que tendrán muchas oportunidades para crear valor comercialmente y para el beneficio público. “En Anthropic, estamos trabajando para construir sistemas de IA confiables, interpretables y orientables. Si bien los grandes sistemas generales de IA de la actualidad pueden tener beneficios significativos, también pueden ser impredecibles, poco confiables y opacos. Nuestro objetivo es avanzar en estos temas e implementar sistemas que la gente encuentre útiles”, dijo Tom Brown, cofundador de Anthropic. “Nuestra organización es una de las pocas en el mundo que está construyendo modelos fundamentales en la investigación de aprendizaje profundo.
Estos modelos son muy complejos y, para desarrollar y entrenar estos modelos de vanguardia, debemos distribuirlos de manera eficiente en grandes grupos de GPU. En la actualidad, utilizamos las instancias P4 de Amazon EC2 de forma extensiva, y estamos entusiasmados con el próximo lanzamiento de las instancias P5. Esperamos que brinden beneficios sustanciales de precio-rendimiento en comparación con las instancias P4d, y estarán disponibles a la escala masiva requerida para construir modelos de lenguaje grande de próxima generación y productos relacionados”.
Cohere, un pionero líder en IA de lenguaje, empodera a cada desarrollador y empresa para crear productos increíbles con tecnología de procesamiento de lenguaje natural (NLP) líder en el mundo mientras mantiene sus datos privados y seguros. “Cohere lidera el cargo de ayudar a todas las empresas a aprovechar el poder de la IA del lenguaje para explorar, generar, buscar y actuar sobre la información de una manera natural e intuitiva, implementando múltiples plataformas en la nube en el entorno de datos que funciona mejor para cada cliente. ”, dijo Aidan Gómez, CEO de Cohere. “Las instancias Amazon EC2 P5 con tecnología NVIDIA H100 darán rienda suelta a la capacidad de las empresas para crear, crecer y escalar más rápido con su poder de cómputo combinado con el LLM de última generación y las capacidades de IA generativa de Cohere”.
Hugging Face tiene la misión de democratizar el buen aprendizaje automático. “Como la comunidad de código abierto de más rápido crecimiento para el aprendizaje automático, ahora proporcionamos más de 150 000 modelos preentrenados y 25 000 conjuntos de datos en nuestra plataforma para NLP, visión por computadora, biología, aprendizaje reforzado y más”, dijo Julien Chaumond, CTO y co- fundador de Hugging Face. “Con avances significativos en modelos de lenguajes grandes e inteligencia artificial generativa, estamos trabajando con AWS para construir y contribuir con los modelos de código abierto del mañana. Esperamos usar instancias P5 de Amazon EC2 a través de Amazon SageMaker a escala en UltraClusters con EFA para acelerar la entrega de nuevos modelos básicos de IA para todos”.
Hoy, más de 450 millones de personas en todo el mundo usan Pinterest como una plataforma de inspiración visual para comprar productos personalizados a su gusto, encontrar ideas para hacer sin conexión y descubrir a los creadores más inspiradores. «Utilizamos el aprendizaje profundo de forma extensiva en nuestra plataforma para casos de uso como el etiquetado y la categorización de miles de millones de fotos que se cargan en nuestra plataforma y la búsqueda visual que brinda a nuestros usuarios la capacidad de pasar de la inspiración a la acción», dijo David Chaiken, jefe Arquitecto en Pinterest. «Hemos creado e implementado estos casos de uso aprovechando las instancias de GPU de AWS, como P3 y las últimas instancias de P4d. Esperamos utilizar instancias P5 de Amazon EC2 con GPU H100, EFA y Ultraclusters para acelerar el desarrollo de nuestros productos y brindar nuevas experiencias basadas en IA empática a nuestros clientes”.
Como líder en el desarrollo y la implementación de modelos de IA multimodales y de código abierto, Stability AI colabora con socios del sector público y privado para llevar esta infraestructura de próxima generación a una audiencia global. “En Stability AI, nuestro objetivo es maximizar la accesibilidad de la IA moderna para inspirar la creatividad y la innovación globales”, dijo Emad Mostaque, director ejecutivo de Stability AI. “Inicialmente nos asociamos con AWS en 2021 para crear Stable Diffusion, un modelo de difusión latente de texto a imagen, utilizando instancias P4d de Amazon EC2 que empleamos a escala para acelerar el tiempo de capacitación del modelo de meses a semanas. A medida que trabajamos en nuestra próxima generación de modelos de IA generativa de código abierto y nos expandimos a nuevas modalidades, nos complace utilizar instancias Amazon EC2 P5 en EC2 UltraClusters de segunda generación.
Nuevos diseños de servidores para una IA escalable y eficiente
Antes del lanzamiento de H100, los equipos de ingeniería de NVIDIA y AWS con experiencia en los campos térmico, eléctrico y mecánico han colaborado para diseñar servidores que aprovechen las GPU para ofrecer IA a escala, con un enfoque en la energía. eficiencia en la infraestructura de AWS. Las GPU suelen ser 20 veces más eficientes energéticamente que las CPU para ciertas cargas de trabajo de IA, y el H100 es hasta 300 veces más eficiente para LLM que para CPU.
El trabajo conjunto ha incluido el desarrollo de un diseño térmico del sistema, seguridad integrada y administración del sistema, seguridad con el hipervisor acelerado por hardware AWS Nitro y optimizaciones NVIDIA GPUDirect™ para la estructura de red EFA personalizada de AWS.
Basándose en el trabajo de AWS y NVIDIA centrado en la optimización de servidores, las empresas han comenzado a colaborar en futuros diseños de servidores para aumentar la eficiencia de escalado con diseños de sistemas, tecnologías de enfriamiento y escalabilidad de red de generación posterior.
