Millones de alertas por noche y una máquina que elige cuáles importan

Un cartografiado moderno del cielo compara cada imagen nueva con una imagen de referencia del mismo campo y anota todo lo que ha cambiado. Ese procedimiento, que suena inocente, produce en una sola noche cientos de miles de avisos en las instalaciones que llevan años funcionando y se espera que produzca millones en las que están entrando en servicio.

De todo eso, lo que resulta ser un fenómeno astronómico real es una fracción pequeña. El resto son artefactos: restas mal alineadas, rayos cósmicos, reflejos internos del telescopio, espigas de difracción de estrellas brillantes, estelas de satélites. Y dentro de lo real, casi todo son estrellas variables corrientes y asteroides ya catalogados.

Encontrar entre ese caudal la supernova que interesa, o el fenómeno que nadie ha visto antes, dejó de ser un trabajo humano hace más de una década. Lo que hay ahora es una cadena de modelos estadísticos, cada uno con su tasa de error, y un margen muy estrecho para que un astrónomo intervenga a tiempo.

Lo esencial de la cadena

  • El caudal. De cientos de miles a millones de avisos por noche, con segundos de margen para decidir.
  • Primer filtro. Separar detección real de artefacto, con redes entrenadas sobre recortes de imagen.
  • Segundo filtro. Clasificar el tipo de fenómeno a partir de una curva de luz casi siempre incompleta.
  • El número que duele. Un uno por ciento de falsos positivos sobre diez millones son cien mil objetos falsos cada noche.
  • El cuello de botella real. No el clasificador, sino los espectrógrafos disponibles para confirmar.

Un caudal que ningún turno humano puede revisar

Cúpula de observatorio abierta durante la noche con el cielo estrellado detrás

Conviene poner la escala en términos de trabajo. Si una persona entrenada dedica cinco segundos a mirar un recorte de imagen y decidir si es real, revisa unos setecientos por hora. Una noche completa de una instalación mediana le llevaría meses.

Durante los años noventa y buena parte de la década siguiente, ese trabajo se hacía efectivamente a mano, con equipos de estudiantes revisando candidatos por la mañana. Funcionaba porque los cartografiados de entonces producían decenas o cientos de candidatos por noche, no cientos de miles.

El cambio de escala vino de tres sitios a la vez: cámaras con campos de visión de varios grados cuadrados, cadencias de repetición de días en lugar de meses y detectores con más píxeles. Cada uno de esos factores multiplica el número de detecciones, y se multiplican entre sí.

La consecuencia estructural es que la decisión pasó a ser parte del instrumento. Un cartografiado moderno no entrega imágenes: entrega un flujo de avisos ya clasificados, y la calidad de esa clasificación determina qué ciencia se puede hacer con la instalación. En ese sentido el clasificador es tan crítico como el espejo, y esa es una de las novedades de las técnicas que han transformado la astronomía reciente.

Primer filtro: separar lo real de lo espurio

La primera decisión es binaria y tiene nombre propio en la jerga: real o espurio. No se pregunta qué es el objeto, solo si el punto que ha aparecido en la imagen de resta corresponde a algo que está en el cielo.

La entrada típica del modelo son tres recortes cuadrados de unas pocas decenas de píxeles centrados en el candidato: la imagen nueva, la imagen de referencia y la resta de ambas. Un artefacto se delata en la forma del residuo, en la asimetría del perfil, en la presencia de valores negativos junto a los positivos o en la orientación respecto a una estrella brillante cercana.

Los primeros sistemas extraían de esos recortes una lista de medidas —anchura del perfil, elongación, brillo de fondo, distancia a la fuente más próxima, número de píxeles saturados— y alimentaban con ellas un clasificador de árboles. Funcionaban bien y tenían una virtud que se echa de menos después: se podía preguntar qué medida había pesado en cada decisión.

La generación siguiente prescinde de esas medidas y pasa los recortes directamente a una red convolucional, que aprende por su cuenta qué patrones importan. El rendimiento mejora, sobre todo en los casos difíciles, y la interpretabilidad se pierde casi entera. Es un intercambio consciente y bastante discutido en la literatura del campo.

Por qué un uno por ciento sigue siendo cien mil errores

Los clasificadores publicados de este primer filtro alcanzan tasas de error del orden del uno por ciento en ambos sentidos: alrededor de uno de cada cien artefactos pasa como real, y alrededor de uno de cada cien objetos reales se descarta.

Sobre un conjunto de prueba, ese resultado parece excelente. Sobre el caudal real deja de serlo. Un millón de avisos por noche con un uno por ciento de contaminación produce diez mil objetos falsos; diez millones producen cien mil. Ninguna cadena posterior está dimensionada para absorber eso.

El problema se agrava por el desequilibrio de clases. Si de cada mil candidatos solo uno es real, un clasificador con un uno por ciento de falsos positivos entrega diez falsos por cada verdadero, aunque su exactitud global sea del noventa y nueve por ciento. La exactitud es, en este contexto, una métrica engañosa que conviene no citar nunca sola.

La salida práctica es encadenar filtros con criterios independientes: exigir detección en dos noches distintas, comprobar que el centroide no se desplaza respecto a la fuente subyacente, cruzar con los catálogos de asteroides conocidos y con los de estrellas variables. Cada cruce recorta el caudal más que cualquier mejora del modelo.

Cómo funciona la clasificación automática de transitorios

Superado el filtro binario, empieza el problema interesante: decidir qué es cada objeto que ha quedado. Y aquí la información disponible es mucho peor de lo que parece.

Lo que hay es una curva de luz: una serie de medidas de brillo en dos o tres filtros, tomadas en momentos irregulares, con huecos por mal tiempo y por la posición de la Luna, y casi siempre incompleta porque el fenómeno todavía está ocurriendo. Clasificar con la curva entera, a posteriori, es un ejercicio académico; clasificar con los tres primeros puntos, que es lo que hace falta para decidir un seguimiento, es otra cosa.

El objetivo suele plantearse como una jerarquía en lugar de como una lista plana. Primero se separa lo que está en el sistema solar de lo que está fuera; después, dentro de lo extragaláctico, se separan las explosiones de un solo episodio de las fuentes que varían de forma recurrente; y solo al final se distingue entre subtipos de supernova o entre categorías más raras.

Esa estructura tiene una ventaja operativa: cada nivel puede tener su propio umbral de confianza y su propia acción asociada. Un candidato que llega al segundo nivel con alta probabilidad de ser una explosión joven dispara una alerta de seguimiento aunque el subtipo siga siendo incierto.

Bosques aleatorios sobre rasgos medidos

La primera familia de modelos que se aplicó en serio a este problema trabaja sobre rasgos calculados a partir de la curva de luz: amplitud, pendiente de subida, pendiente de bajada, color en el máximo, evolución del color, dispersión de las medidas, presencia de periodicidad.

Con esas decenas de números se entrena un conjunto de árboles de decisión que votan. La técnica es antigua, robusta con datos ruidosos y muy tolerante a valores ausentes, que en astronomía abundan. Y es interpretable: se puede listar qué rasgos han resultado más informativos, y esa lista suele coincidir con lo que un astrónomo habría mirado.

Su limitación está en los rasgos mismos. Calcular una pendiente de bajada exige que la curva tenga bajada, y en el momento en que hay que decidir el seguimiento no la tiene. Estos modelos rinden muy bien sobre archivos históricos completos y mucho peor en tiempo real.

Siguen en uso, y no por inercia. Varios sistemas en producción combinan un modelo de este tipo sobre la curva acumulada con otro basado en imagen sobre la primera detección, y usan la coincidencia o la discrepancia entre ambos como indicador de fiabilidad.

Redes convolucionales sobre la primera imagen

El enfoque complementario renuncia a la curva y se queda con lo único disponible en la primera detección: el recorte de imagen. Una red convolucional entrenada sobre miles de ejemplos etiquetados aprende a distinguir entre un núcleo galáctico activo, una explosión desplazada del centro de su galaxia anfitriona, una estrella variable de nuestra galaxia y un objeto del sistema solar.

La información que explota es sobre todo contextual: dónde está el candidato respecto a la fuente extendida más cercana, qué aspecto tiene esa fuente, si el campo está poblado de estrellas o vacío. Es exactamente lo que un astrónomo evalúa de un vistazo, y resulta que una red lo aprende bien.

El resultado es una clasificación grosera pero disponible desde el primer segundo, que se refina después con la curva de luz según van llegando puntos. Esa combinación de un modelo rápido y ciego a la evolución con otro lento e informado es la arquitectura dominante en los sistemas actuales.

Queda una debilidad conocida: las redes convolucionales aprenden también las peculiaridades del instrumento con el que se entrenaron. Un modelo afinado sobre imágenes de una cámara concreta pierde rendimiento sobre otra con distinta escala de píxel, distinto perfil óptico o distinto tratamiento del fondo, y hay que reentrenarlo.

Redes recurrentes y modelos de atención para curvas incompletas

La tercera familia aborda directamente el problema de la serie temporal irregular. Las redes recurrentes procesan la secuencia de medidas en orden, manteniendo un estado interno que se actualiza con cada punto nuevo, y devuelven una clasificación que se puede consultar en cualquier momento.

Esa propiedad encaja perfectamente con el caso de uso: el modelo emite una probabilidad tras el primer punto, la revisa tras el segundo y así sucesivamente. Se puede fijar un umbral y disparar el seguimiento en cuanto se supere, sin esperar a que la curva termine.

Los modelos basados en mecanismos de atención han ido desplazando a los recurrentes en trabajos recientes, porque manejan mejor los intervalos irregulares entre medidas y permiten incorporar información adicional —el filtro usado, la calidad de la noche, el desplazamiento respecto a la galaxia anfitriona— como entradas paralelas.

Familia de modelo Entrada Disponible desde Punto fuerte Punto débil
Árboles y bosques rasgos medidos de la curva curva parcialmente completa interpretable y robusto inútil en las primeras horas
Red convolucional recortes de imagen primera detección usa el contexto de la anfitriona aprende el instrumento
Red recurrente secuencia de medidas desde el segundo punto se actualiza con cada dato sensible a huecos largos
Modelos de atención secuencia irregular más contexto desde el segundo punto integra fuentes heterogéneas exige muchos ejemplos etiquetados

El problema que ningún modelo resuelve: las clases raras

Todo lo anterior funciona razonablemente para lo abundante. Las supernovas de tipo termonuclear y las de colapso de núcleo suman la inmensa mayoría de lo que se detecta, y hay decenas de miles de ejemplos etiquetados para entrenar.

Lo que interesa científicamente suele ser lo contrario. Las disrupciones de marea, en las que una estrella se acerca demasiado a un agujero negro supermasivo y se desgarra, se cuentan por decenas. Las supernovas superluminosas, por unos pocos cientos. Las contrapartidas ópticas de fusiones de objetos compactos, por unidades.

Un modelo entrenado con esas proporciones aprende, correctamente desde el punto de vista estadístico, que la respuesta segura es siempre la clase mayoritaria. Las técnicas para contrarrestarlo —reponderar las clases, generar ejemplos sintéticos, entrenar con conjuntos artificialmente equilibrados— mejoran la sensibilidad a lo raro a costa de multiplicar los falsos positivos en esas mismas clases.

El resultado práctico es incómodo: el sistema encuentra bien lo que ya se conocía bien, y para lo demás hay que aceptar listas de candidatos con una pureza baja que alguien tiene que revisar. En la práctica, casi todas las colaboraciones que persiguen fenómenos raros mantienen un turno humano diario sobre esas listas.

Entrenar con simulaciones y aplicar a datos reales

Cuando no hay ejemplos reales suficientes, la salida es simular. Se generan curvas de luz sintéticas a partir de modelos físicos de cada tipo de explosión, se les añade el ruido y la cadencia del instrumento y se entrena con ellas.

El método funciona y tiene un fallo estructural: el modelo aprende las propiedades de la simulación, no las del cielo. Si el modelo físico de una clase es incompleto, o si el ruido simulado no reproduce las correlaciones del detector real, el clasificador rinde de maravilla en validación y se degrada al enfrentarse a datos auténticos.

Ese desajuste entre el dominio de entrenamiento y el de aplicación es probablemente el problema abierto más serio del campo. Se aborda con adaptación de dominio, con validación cruzada sobre los pocos datos reales etiquetados disponibles y con vigilancia continua de la distribución de salidas del modelo, buscando derivas.

Un ejercicio colectivo organizado hace unos años planteó exactamente este escenario: entrenar con un conjunto simulado pequeño y clasificar un conjunto mucho mayor con una distribución de clases distinta. Los mejores resultados llegaron de combinaciones de modelos y de un tratamiento cuidadoso del desequilibrio, no de arquitecturas más grandes.

Pureza, completitud y el umbral que decide todo

Un clasificador no devuelve una etiqueta: devuelve un número entre cero y uno. La etiqueta aparece cuando alguien fija un umbral, y ese umbral no es una decisión técnica sino científica.

Subir el umbral aumenta la pureza de la lista resultante y reduce su completitud: se pierden objetos reales por exceso de prudencia. Bajarlo hace lo contrario. No existe un valor correcto en abstracto; existe el valor adecuado para lo que se vaya a hacer con la lista.

Un programa que quiera medir la tasa de explosiones en un volumen de universo necesita completitud alta y, sobre todo, conocer exactamente qué fracción se le escapa: una lista sesgada de forma desconocida es peor que una lista incompleta de forma conocida. Un programa que vaya a gastar tiempo de telescopio grande en cada candidato necesita pureza, aunque pierda la mitad de los objetos.

La conclusión metodológica es que cada uso requiere caracterizar el sesgo del clasificador para su caso concreto, y eso significa medir la eficiencia de recuperación inyectando fuentes artificiales en las imágenes. Es un trabajo tedioso, se hace menos de lo que debería, y es lo que separa un catálogo utilizable para medidas cosmológicas de precisión de una simple lista de avisos.

El espectrógrafo es el cuello de botella, no el clasificador

Instrumento espectrográfico montado bajo un telescopio, con cables y carcasas metálicas a la vista
Photograph by Mike Peel (www.mikepeel.net). / BY-SA 4.0

Una clasificación fotométrica es una probabilidad. La confirmación exige un espectro, y ahí la capacidad instalada en el planeta no ha crecido al ritmo de las cámaras.

La proporción resultante es llamativa. De las decenas de miles de explosiones que se descubren cada año, solo una fracción pequeña llega a tener espectro, y con los cartografiados de nueva generación esa fracción bajará a valores de milésimas. La consecuencia es que la astronomía de transitorios pasa a depender de clasificaciones probabilísticas para casi todo su volumen.

Eso ha empujado dos respuestas. La primera es automatizar también la espectroscopía: hay instrumentos dedicados que toman espectros de baja resolución de forma robótica y los clasifican con modelos entrenados para ello, sin intervención humana en ningún punto de la cadena. Un sistema así llegó a descubrir, seleccionar, solicitar el espectro y clasificar una supernova sin que nadie tocara nada, lo que en su momento se documentó como el primer ciclo completamente autónomo.

La segunda respuesta es aceptar la incertidumbre y trabajar con ella: hacer estadística con clasificaciones probabilísticas, propagando las probabilidades a los resultados finales en lugar de forzar una etiqueta. Es metodológicamente más correcto y bastante más laborioso.

Qué sigue haciendo el astrónomo

La respuesta corta es todo lo que no es repetitivo, y resulta ser bastante.

Primero, definir el conjunto de entrenamiento. Las etiquetas con las que aprende el modelo salen de decisiones humanas previas, y cualquier sesgo en ellas se propaga entero. Un catálogo de entrenamiento construido a partir de objetos brillantes y bien observados enseña al modelo a encontrar objetos brillantes y bien observados.

Segundo, vigilar la deriva. Un clasificador en producción se degrada cuando cambia el instrumento, cuando cambia la calidad media de las noches o cuando aparece una fuente de artefactos nueva, como el aumento de estelas de satélites. Detectar esa degradación exige mirar las distribuciones de salida periódicamente, y nadie más va a hacerlo.

Tercero, decidir el seguimiento. Ante una lista de veinte candidatos con probabilidades parecidas y tiempo para tres, la elección depende de qué preguntas están abiertas en el campo, y eso no está en ningún conjunto de datos.

Y cuarto, encontrar lo que no tiene clase. Los descubrimientos que han abierto categorías nuevas salieron, en general, de alguien que miró un objeto raro con atención en lugar de descartarlo por baja probabilidad. Las estrategias de detección de anomalías intentan automatizar eso, con resultados prometedores y ninguna garantía. Los sistemas de alerta que gestionan agencias como la Agencia Espacial Europea y la nomenclatura común que coordina la Unión Astronómica Internacional son la infraestructura sobre la que todo esto circula.

Preguntas frecuentes

¿Quién recibe las alertas de un cartografiado?

Los flujos se distribuyen a través de sistemas intermediarios que se suscriben al caudal completo, lo enriquecen con catálogos externos y aplican sus propios clasificadores. Cada grupo de investigación se conecta al intermediario que mejor se ajusta a su ciencia y define filtros propios sobre el flujo ya procesado.

¿Cuánto tiempo hay para decidir?

Depende del fenómeno. Para una supernova, horas o días. Para la contrapartida óptica de una señal de ondas gravitacionales, minutos, porque el brillo decae muy deprisa. Esa segunda escala es la que ha obligado a que toda la cadena funcione sin intervención humana.

¿Los modelos se comparten entre instalaciones?

Los métodos sí, y buena parte del código es abierto. Los modelos entrenados, en cambio, rara vez se transfieren directamente porque aprenden características del instrumento concreto. Lo habitual es reutilizar la arquitectura y reentrenar con datos propios.

¿Qué pasa con las estelas de satélites?

Se han convertido en una fuente de artefactos creciente y con una firma característica, lineal y brillante, que los clasificadores detectan bien una vez se les entrena con ejemplos. El problema no es tanto clasificarlas como que arruinan la fotometría de todo lo que quede debajo de la traza.

¿Puede un aficionado trabajar con estos datos?

Sí, y de hecho ocurre. Los flujos de alertas de varias instalaciones son públicos, existen interfaces de consulta abiertas y hay proyectos de revisión colaborativa que aprovechan la inspección visual humana precisamente en los casos donde los modelos dudan. Es una de las vías de participación más activas hoy.

El clasificador ha dejado de ser una herramienta auxiliar para convertirse en parte del instrumento, con la incomodidad que eso trae: sus errores no son ruido aleatorio, son sesgos sistemáticos que se propagan a cualquier medida hecha con el catálogo resultante. Caracterizarlos bien importa tanto como calibrar el espejo.