- Estamos presentando la Tormenta de Pérdida de Energía Instantánea, un nuevo paradigma de pruebas dentro de la metainfraestructura para gestionar y mitigar cortes de energía instantáneos o imprevistos en nuestros centros de datos.
- compartimos: Cómo construimos la disposición para tolerar fallas inmediatas en nuestros sistemas existentes utilizando estrategias de defensa profundas; qué compromisos se hicieron durante la implementación y cómo confirmamos nuestra voluntad.
La preparación para desastres no es una opción. Huracanes, incendios forestales, interrupciones de energía y red, y muchos otros escenarios de desastre plantean riesgos para nuestro centro de datos (corriente continua) infraestructura.
Los sistemas de alerta temprana y las estrategias de mitigación comprobadas ya nos son útiles en situaciones en las que la alerta anticipada tarda unas horas o más.. Si bien estas estrategias han madurado con el tiempo a medida que hemos ampliado nuestra presencia en DC, El tamaño y la diversidad cada vez mayores de nuestra infraestructura requieren un mayor nivel de preparación para desastres impredecibles. (los que ocurren sin previo aviso), como: pérdida instantánea de potenciacon impacto mínimo en la disponibilidad general de la flota.
Instantaneous PowerLoss Storm es un nuevo paradigma de prueba dentro del metamétodo establecido desde hace mucho tiempo. Preparación para desastres (DR)"Tormenta"Programa que proporciona la última línea de defensa y la red de seguridad definitiva para gestionar y mitigar cortes de energía inmediatos o imprevistos debido a causas conocidas., riesgos emergentes y desconocidos.
Cómo construimos la disposición para tolerar fallas inmediatas en nuestros sistemas existentes utilizando estrategias de defensa en profundidad.
La capacidad de manejar un corte de energía instantáneo tuvo que incorporarse a nuestra pila de CC desde cero., desde mecánicos y eléctricos hasta racks de servidores, Del almacenamiento a la computación y al núcleo. cable Orquestador de contenedores. Afortunadamente, Cada una de estas arquitecturas ya ha sido diseñada con la tolerancia a fallas de energía como un componente integral..
Proporciona la capacidad de retener datos en memoria cuando los racks se quedan sin energía usando baterías y baterías recargables. Sirena en caso de corte de energía (por favor) es una de esas capacidades. Otra ventaja es tener un mecanismo de señalización asíncrono robusto en toda la región de DC para los servicios Twine en forma de eventos de indisponibilidad. (UE). (Una región de DC – en lo sucesivo denominado como «región» – es una región en la que varios edificios de CC están ubicados uno al lado del otro y comparten una red y una conexión eléctrica comunes.)
Si bien estas capacidades fueron probadas y reforzadas en dominios de fallas individuales dentro de centros de datos individuales, Identificamos vulnerabilidades destacadas en escenarios que abarcaron toda una región.. Además, al probar una región, no sólo tuvimos que lidiar con cuestiones de escala (una región típica suele tener entre 50 y 60 veces el tamaño de los dominios de falla típicos) y colocación de réplicas, pero también cuestiones de arranque autónomo.
Arranque Se refiere a poner en marcha una región apagada y requiere que millones de servicios se inicien a la vez y se descubran entre sí de forma autónoma.. A continuación describimos dos de los problemas que encontramos durante el arranque y que requirieron la introducción de un Enfoque de cinturón y tirantes para cubrir todas las posibles eventualidades y contingencias.
Un problema destacado que nos ha perseguido desde el principio es el de las dependencias y especialmente las temidas dependencias. dependencia circular, “uróboros«Riesgo! Nuestro orquestador Twine cuenta con una serie de servicios de plano de control. – planificadorasignador, corredor, Celoso (coordinador) etc.. – sin el cual no podemos operar o iniciar otros servicios en la región. Si bien el riesgo de dependencias circulares es bajo en las operaciones regulares, El riesgo y el impacto son mucho mayores cuando se inicia una región entera.. Es un verdadero problema del huevo y la gallina.
Resolvimos este problema mediante la identificación. dependencias críticas de inicio entre los servicios del avión de control, y continuamente detectamos estos temprano y a menudo con Pruebas de Belljar en nuestros canales de CI/CD. Estos ayudaron a descubrir y eliminar la mayoría, si no todos, riesgos de dependencia antes de implementarlos en producción. Dado el rápido desarrollo de nuestra infraestructura y como solución de cinturón y tirantes, nosotros también necesitábamos esto Capacidad A Romper todas las dependencias circulares esto puede haber sucedido inesperadamente. Un kit de recuperación de Twine especialmente diseñado proporciona esta capacidad de "arranque rápido" para restaurar los servicios de Twine que operan el propio Twine.. Junto con Belljar y Twrko, hemos conseguido acabar con éxito con el espectro de las dependencias circulares.
También estamos en un “Bumerang» Problema en el mismo entorno. – El Generador de una señal crítica influenciada por la misma señal.. Los UE utilizados para orquestar el cierre y la recuperación del servicio terminaron cerrando ellos mismos los servicios del plano de control del Orchestrator., dando como resultado servicios huérfanos que ya no podían ejecutarse.cosechado" (porque nunca recibieron un UE.) Si bien este problema podría haberse resuelto con soluciones complicadas, como excluir un conjunto preestablecido de servicios de la lista de despacho de la UE, Optamos por un enfoque más simple y sostenible al permitir que los servicios del plano de control simplemente "ignoren" las señales de apagado asociadas con los UE relacionados con la energía..
![imagen[2]-Luces apagadas, Sistemas encendidos: Validación de la preparación para pérdida instantánea de energía para Windows 7,8,10,11-Winpcsoft.com](https://winpcsoft.com/wp-content/plugins/wp-fastest-cache-premium/pro/images/blank.gif)
Compensaciones para encontrar el equilibrio adecuado entre confiabilidad y velocidad de crecimiento.
Si bien es factible crear una tolerancia hermética a las pérdidas inmediatas, Hacerlo puede conllevar un costo de oportunidad en infraestructura o el riesgo de realizar una ingeniería excesiva en nuestros sistemas.. Esto último conlleva incluso el riesgo de que las falsas alarmas afecten las operaciones regulares.. Por lo tanto, Tuvimos que hacer ciertos compromisos para encontrar el equilibrio adecuado entre confiabilidad y tecnología..
Empezamos trazando la línea en la que se deben evitar los impactos.. Pérdida de datos de sistemas de almacenamiento y bases de datos., daños permanentes a las instalaciones de DC (mecanico/electrico), o impactos duraderos más allá de una sola región son algunos que hemos establecido claramente como requisitos esenciales. Fallos transitorios del servicio, fallas en el rack (dentro de un umbral predefinido), y estancamiento limitado en las tablas de enrutamiento de servicios o detección de indisponibilidad de región (este es un problema). Problema difícil para sistemas asíncronos.) fueron vistos como riesgos tolerables. En general, Solo problemas que quedaron fuera del límite de impactos tolerables que no pueden mitigarse mediante acciones correctivas posteriores al incidente y dentro de un tiempo medio de respuesta razonable. (MTTR).
Cómo confirmamos nuestra preparación a través del ejercicio Instantaneous PowerLoss Storm y cómo esto nos permite traspasar los límites aún más.
Validar las expectativas anteriores y prepararse cerrando una gran región de producción implica riesgos importantes con varias incógnitas conocidas y desconocidas.. Para resolver este problema del huevo y la gallina de asumir riesgos para abordarlos, Desarrollamos un enfoque incremental en el que validamos problemas autónomos, como las dependencias, a medida que surgían nuevas regiones/regiones de preproducción y ejecutamos pruebas en "regiones sombra" que replican regiones de producción.. Luego pudimos probar con éxito nuestro nuevo (y por lo tanto más pequeño) Regiones de producción con un radio de explosión limitado.. Finalmente, cerramos grandes regiones de producción que albergan almacenamiento crítico, AI, y cargas de trabajo de almacenamiento de datos. En este punto hemos denominado a estos simulacros de asalto Tormentas inmediatas con cortes de energía.
Desde una altitud de 10,000 pies, la tormenta consiste en un corte de energía inyectado que resulta en el cierre inmediato de toda la región y después de un corto MTTR, Se toman medidas correctivas para aislar la región afectada de los controladores/planificadores globales.. También queríamos evitar tomar medidas preventivas antes de las pruebas que pudieran constituir un corte de energía inesperado.. El MTTR seleccionado para las pruebas reflejó el MTTR típico observado en escenarios de incidentes reales..
Each of these exercises helped iteratively train our infrastructure and engineers toward the long-term goal of managing the loss of a region as seamlessly as the loss of a subregional fault domain.
Trampolín hacia el futuro: lento es suave. Suave es rápido
A pesar de todas las precauciones, este no fue un viaje completamente tranquilo, sino un viaje con numerosas oportunidades de aprendizaje y mejora., lo que no solo mejoró nuestras capacidades de prueba, pero también se reflejó en toda nuestra infraestructura y generó varias mejoras arquitectónicas en nuestros sistemas existentes..
Los nuestros en tándem La infraestructura ha evolucionado rápidamente para cubrir innumerables casos de uso de capacidad e inteligencia artificial.. La acción rápida sólo es posible si tenemos una base sólida. fiabilidad Y velocidad son dos caras de la misma moneda. No puedes tener uno sin el otro. La capacidad de restaurar una región después de una interrupción repentina ha sentado una base sólida que nos ha permitido innovar y validar diseños de CC., Genere confiabilidad al mismo tiempo que implementaciones rápidas de capacidad., y continuar superando los límites de riesgo que podemos tolerar.
Si bien las tormentas anteriores validaron principalmente el almacenamiento y los backends de bases de datos, Seguimos la misma estrategia incremental para validar regiones con tráfico de clientes en vivo contra fallas inmediatas.. (Más sobre esto en una próxima publicación.!) También revisamos y reelaboramos constantemente las compensaciones a la luz de los nuevos desafíos que surgen en esta fase de crecimiento..
