
En una planta industrial hay equipos críticos y equipos que pueden esperar. En un centro de datos, casi no hay de los segundos. Todo lo que está entre la acometida y el servidor existe para que la operación no se detenga nunca, y una falla en cualquier punto de esa cadena puede tirar un rack, una sala o el sitio completo.
Por eso la forma de vigilar térmicamente un centro de datos es distinta a la de una planta. No se trata de encontrar el punto que ya está muy caliente: se trata de ver el primer cambio, aunque sea de un grado, y entender qué lo provocó antes de que se convierta en falla.
Lo que está en juego
Una falla eléctrica o térmica en un centro de datos no se mide solo en el costo de la reparación. Se mide en servicios caídos, en clientes que no pueden operar, en penalizaciones por incumplir los niveles de servicio y en reputación. Y hay algo más delicado: los datos. Un apagado no controlado puede dañar equipos, interrumpir transacciones a la mitad y, en el peor caso, provocar pérdida o corrupción de información que no siempre se puede recuperar.
Frente a eso, el costo de vigilar de más es mínimo. Por eso aquí conviene ser estricto desde el principio.
Por qué no conviene esperar a una tabla de severidad
En la termografía industrial es común calificar un punto caliente con tablas que dicen a partir de cuántos grados de diferencia un hallazgo es menor, importante o crítico. Son útiles para ordenar cientos de hallazgos en una planta, pero en un centro de datos llegan tarde: cuando un punto cae en la categoría de crítico, la conexión ya lleva tiempo deteriorándose y el margen para corregirla sin afectar la operación es mucho menor.
Nuestro criterio en centros de datos es otro: cada punto se compara contra su propia historia y contra su gemelo. Un aumento sostenido de un grado que no se explica por un cambio de carga o de temperatura ambiente ya merece revisión. Puede ser una conexión que empieza a aflojarse, un ventilador que pierde capacidad o una celda de batería que empieza a degradarse.
Qué componentes vigilar
Tableros, transferencias y busway
Las conexiones de los tableros principales, las transferencias automáticas y estáticas y los ductos de barras son el origen más común de calentamientos. Una conexión que se afloja aumenta su resistencia, se calienta, se oxida y se afloja más. Es un proceso que puede tardar meses o, con carga alta, unas cuantas semanas.
UPS
En los UPS se vigilan las conexiones de entrada y salida, los capacitores, los semiconductores y los ventiladores. Un ventilador que pierde capacidad se nota primero como un aumento pequeño y constante de temperatura en los módulos.
Bancos de baterías
Son probablemente lo más sensible de todo el sitio. La temperatura acorta la vida de las baterías: como referencia general, cada aumento de unos pocos grados sobre la temperatura de diseño reduce de forma importante su vida útil. Además, una celda que se calienta más que sus vecinas puede ser el inicio de una falla que arrastre al banco completo, o de un embalamiento térmico. Se revisan celda por celda y las conexiones entre celdas.
PDU y distribución en racks
Las unidades de distribución de energía, sus contactos y los cables de alimentación de los racks más cargados. Aquí los calentamientos suelen venir de conexiones mal asentadas o de circuitos trabajando cerca de su límite.
Aire de precisión y racks
Las unidades de aire acondicionado de precisión, sus compresores y ventiladores, y la temperatura de entrada de aire a los racks. La guía de ASHRAE recomienda mantener el aire de entrada a los equipos de cómputo entre 18 y 27 °C. Puntos calientes en el frente de un rack, o aire caliente que regresa a la entrada, suelen indicar recirculación, paneles ciegos faltantes o pasillos mal confinados.
Generadores y equipo de respaldo
Los generadores y sus tableros de transferencia también se revisan, aunque trabajen poco: son los que tienen que responder el día que todo lo demás falle.
Por qué los sensores del cuarto no alcanzan
Un sensor de temperatura ambiente mide el aire en un punto. Una conexión floja dentro de un tablero puede estar a 80 °C mientras el aire del cuarto sigue en 22 °C. La termografía ve la superficie de cada componente, y por eso encuentra el problema donde el sensor del cuarto no lo ve, ni lo verá hasta que sea tarde.
Cómo se vigila bien
Levantar todos los puntos de la cadena eléctrica y de enfriamiento, del tablero principal al rack.
Tomar una línea base de cada punto con su carga, para saber cómo se comporta sano.
Comparar cada punto contra su gemelo: el lado A contra el lado B, una fase contra otra, una celda contra sus vecinas.
Vigilar la tendencia, no solo el valor: un cambio pequeño y sostenido importa más que un valor alto aislado.
Medir siempre con carga, porque una conexión con problema solo se calienta cuando pasa corriente.
Usar ventanas infrarrojas en los tableros, para medir sin abrir y sin exponer al personal ni a la operación.
Termografía en ruta y cámaras fijas, juntas
Una ruta de termografía revisa todo el sitio con detalle, componente por componente. En un centro de datos conviene hacerla con más frecuencia que en una planta, por ejemplo cada tres meses. Para los puntos de los que depende todo, como los tableros principales, las transferencias y los bancos de baterías, las cámaras fijas vigilan las 24 horas y avisan en minutos cuando un punto se despega de su comportamiento normal.
Las dos se complementan: la ruta da el detalle y la cámara fija da la continuidad. Y las dos deben alimentar el mismo historial, para que cada medición se compare contra la anterior.
Preguntas frecuentes
¿Hay que apagar algo para hacer la termografía?
No. Al contrario: se hace con todo operando y con carga. Con ventanas infrarrojas instaladas, ni siquiera hace falta abrir los tableros.
¿Qué tan caliente es demasiado?
En un centro de datos, la pregunta útil no es qué tan caliente está, sino cuánto cambió. Un punto que siempre ha estado a 35 °C y hoy está a 37 °C con la misma carga merece más atención que uno que siempre ha estado a 45 °C.
¿Cada cuánto conviene hacer la ruta?
Como referencia, cada tres meses en los sitios críticos, más las cámaras fijas en los puntos de los que depende todo. Si hay cambios de carga importantes o equipo nuevo, conviene una ruta adicional.
¿Sirve para las certificaciones del sitio?
El historial de termografía es evidencia de mantenimiento predictivo que suelen pedir las auditorías y los clientes de un centro de datos. Lo que importa es que sea continuo y que cada hallazgo tenga su corrección documentada.
Hacemos la termografía en ruta de tu centro de datos y proyectos de cámaras térmicas fijas para los puntos críticos, con tendencia y comparación entre gemelos desde el primer grado.
