Un planeta del tamaño de la Tierra cruzando por delante de una estrella como el Sol le quita alrededor de una diezmilésima parte de su brillo, durante unas horas, cada varios cientos de días. Esa es la señal que hay que encontrar dentro de una serie de medidas tomadas cada media hora durante años, en la que el propio ruido instrumental es del mismo orden.
El telescopio que estableció el método vigiló del orden de doscientas mil estrellas a la vez. Su sucesor cubre porciones mucho mayores del cielo con una cadencia más rápida. Nadie mira esas curvas de brillo una por una, y hace ya casi una década que la búsqueda de candidatos no depende solo de algoritmos deterministas.
Los modelos entrenados han recuperado planetas que las revisiones anteriores habían descartado y han validado cientos de candidatos de una sentada. También arrastran los sesgos de aquello con lo que se entrenaron, y siguen dejando fuera, de forma sistemática, las clases de planeta más interesantes.
Lo que hay que retener
- La señal. Una caída de brillo de partes por millón a partes por diez mil, repetida con periodo fijo.
- Dónde entra el modelo. Después de la búsqueda de periodicidades, para separar planetas de falsos positivos.
- Lo que ha aportado. Planetas recuperados de listas descartadas y validación masiva de candidatos.
- El sesgo. Se entrena con lo confirmado, y lo confirmado son planetas grandes y de periodo corto.
- Lo que no sustituye. La distinción entre validar estadísticamente y confirmar con una medida de masa.
Doscientas mil estrellas y una señal de una parte en diez mil
El método de tránsitos es geométricamente exigente. Solo funciona si la órbita del planeta está alineada de canto respecto a nuestra línea de visión, y la probabilidad de que eso ocurra es baja: para un planeta en una órbita como la terrestre alrededor de una estrella como el Sol, ronda el medio por ciento.
Eso obliga a vigilar muchísimas estrellas para encontrar unas pocas. De ahí el diseño del primer gran cartografiado dedicado: apuntar a un solo campo del cielo durante años y medir el brillo de cada estrella de forma repetida y homogénea.
La profundidad de la caída es proporcional al cuadrado del cociente entre el radio del planeta y el de la estrella. Un planeta gigante delante de una estrella pequeña produce una caída de varios puntos porcentuales, imposible de no ver. Un planeta rocoso delante de una estrella como el Sol produce ochenta partes por millón, que es menos que la variabilidad natural de muchas estrellas.
La segunda dificultad es la periodicidad. Un tránsito aislado no prueba nada: hace falta verlo repetirse, y con un periodo largo eso significa años de vigilancia. Toda la cadena de detección está construida alrededor de buscar señales periódicas débiles en series temporales ruidosas.
Del catálogo de eventos al candidato: dónde entra el modelo
La cadena empieza con un algoritmo clásico y determinista que no tiene nada de aprendizaje automático. Se prueba a plegar la curva de luz sobre miles de periodos y fases posibles y se mide, en cada combinación, si aparece una caída coherente. Las combinaciones que superan un umbral estadístico se anotan como eventos.
El problema es que ese procedimiento genera muchísimos más eventos que planetas. La mayoría son artefactos instrumentales, variaciones de la propia estrella o sistemas de estrellas dobles que se eclipsan entre sí. En los conjuntos históricos, la proporción de eventos que acabaron siendo planetas es de una fracción pequeña del total.
Durante años ese cribado lo hicieron personas, revisando gráficos uno por uno con una lista de comprobaciones. Después se sistematizó en un árbol de decisión con reglas explícitas, que era rápido y auditable pero rígido: cada regla tenía un umbral fijo y los casos límite caían siempre del mismo lado.
El paso a modelos entrenados llegó de forma natural. En lugar de codificar a mano qué aspecto tiene un falso positivo, se le muestran al modelo miles de ejemplos etiquetados de ambas clases y se le deja encontrar los patrones. Es exactamente la transición que ha ocurrido en casi todas las líneas de búsqueda de mundos habitables.
Cómo funciona la detección de exoplanetas con IA

La entrada habitual no es la curva completa, sino la curva plegada sobre el periodo candidato, de modo que todos los tránsitos se superponen y la señal se refuerza. Esa curva plegada se presenta al modelo en dos escalas a la vez.
Una es global: la órbita entera comprimida en unos pocos cientos de puntos, donde se ve si hay una segunda caída a mitad de periodo, si el nivel fuera del tránsito es plano y si aparecen modulaciones suaves. La otra es local: una ampliación de las horas alrededor del tránsito, con la forma detallada de la caída, sus bordes y su fondo.
Sobre cada una de esas dos vistas actúa una red convolucional unidimensional, y las salidas de ambas se combinan en las capas finales para producir un único número entre cero y uno. Esa arquitectura de dos ramas es la que se estableció como referencia y sobre la que se han construido casi todas las variantes posteriores.
Las versiones más recientes añaden entradas adicionales que un astrónomo también miraría: el desplazamiento del centro de luz de la estrella durante el tránsito, la profundidad medida en distintas aperturas fotométricas, las propiedades de la estrella anfitriona y la vecindad estelar del campo. Cada una de esas entradas corresponde a una comprobación clásica, ahora integrada en el modelo en lugar de aplicada después.
Con qué se entrena, y por qué eso ya decide el resultado
El conjunto de entrenamiento se construye con eventos ya clasificados por métodos anteriores: los confirmados como planetas por un lado, los identificados como falsos positivos por otro. Es la única fuente disponible de etiquetas fiables en cantidad.
Ahí está la trampa metodológica, y conviene enunciarla sin rodeos. El modelo no aprende qué es un planeta: aprende a reproducir las decisiones que tomaron los procedimientos anteriores. Si esos procedimientos descartaban sistemáticamente un tipo de señal, el modelo entrenado con sus etiquetas hará lo mismo, y además lo hará con más confianza.
El desequilibrio agrava el efecto. Los falsos positivos superan con holgura a los planetas en cualquier catálogo de eventos, así que un modelo que respondiera siempre «no es un planeta» acertaría la mayor parte de las veces. Se contrarresta reponderando las clases o construyendo conjuntos artificialmente equilibrados, y ambos remedios desplazan el punto de operación de formas que hay que medir.
Existe una tercera vía, que es entrenar con tránsitos sintéticos inyectados en curvas de luz reales. Tiene la ventaja de que se controla la verdad de referencia y se pueden generar tantos casos raros como se quiera. Y tiene el inconveniente de siempre: el modelo aprende las propiedades de la inyección, y hay que comprobar que esas propiedades no delatan el origen artificial de la señal.
Los planetas que la red recuperó y nadie había visto
El primer resultado que dio notoriedad al método fue la identificación, en datos ya publicados y ya revisados, de dos planetas que las cribas anteriores habían dejado fuera. Uno de ellos elevó a ocho el número de planetas conocidos en su sistema, igualando por primera vez la cifra del sistema solar.
Es un resultado con una lectura precisa que a veces se pierde. No se descubrió nada nuevo en el cielo: se descubrió que la información ya estaba en un archivo público y que el procedimiento anterior no la había extraído. Los dos planetas eran pequeños y sus señales quedaban justo por debajo del umbral de las reglas fijas.
Unos años después, un modelo más elaborado se aplicó de forma sistemática a todo el catálogo de eventos del mismo telescopio y validó estadísticamente un lote de varios cientos de planetas de una sola vez. Ese salto en el número de objetos validados en una sola publicación no tiene precedentes con métodos manuales.
Ambos casos comparten un patrón. La ganancia del modelo no está en encontrar lo evidente, que ya estaba encontrado, sino en trabajar bien en la zona de señales débiles donde las reglas rígidas tenían que elegir un umbral y equivocarse en un sentido o en otro.
Lo que se le escapa: periodos largos y tránsitos únicos
El punto ciego es sistemático y se conoce bien. Un planeta con un periodo de varios años deja, en una campaña de observación de un año, uno o dos tránsitos. Sin repetición no hay periodo, y sin periodo la curva no se puede plegar, que es lo que el modelo espera como entrada.
Esos eventos aislados quedan fuera de la cadena entera, no solo del clasificador. El algoritmo de búsqueda de periodicidades tampoco los anota, porque busca señales repetidas. Se necesitan procedimientos distintos, diseñados para detectar caídas únicas, y con ellos el ruido de falsos positivos se dispara.
Hay un segundo punto ciego con la misma raíz: los planetas que orbitan sistemas de dos estrellas. Su tránsito no ocurre a intervalos regulares, porque las estrellas se mueven entre sí, y la profundidad varía de un paso a otro. Para un modelo entrenado con tránsitos de periodo fijo y profundidad constante, eso es ruido.
Y un tercero, más sutil: las variaciones en los tiempos de tránsito que produce la presencia de otro planeta en el sistema. Son la firma de compañeros que no transitan, contienen información sobre masas, y desdibujan la señal plegada lo suficiente como para que un clasificador la puntúe peor.
Binarias eclipsantes, el falso positivo que más se parece

Entre todas las señales que imitan un tránsito, la más traicionera es un par de estrellas que se eclipsan mutuamente. Si el eclipse es rasante, o si el par está en el fondo del campo y su luz se mezcla con la de una estrella brillante en primer plano, la caída resultante puede tener la profundidad y la duración de un planeta.
Las comprobaciones clásicas para desenmascararlas son cuatro y todas se han incorporado a los modelos modernos como entradas adicionales.
- Eclipse secundario. Dos estrellas producen una segunda caída, más débil, a mitad de periodo. Un planeta apenas la produce en el óptico.
- Profundidades pares e impares. Si la señal es en realidad un par de estrellas y se ha asignado la mitad del periodo verdadero, los tránsitos alternos tienen profundidades ligeramente distintas.
- Desplazamiento del centroide. Si la fuente que se atenúa no es la estrella objetivo sino una vecina, el centro de luz del conjunto se mueve durante el evento. Es la comprobación más potente y la que más falsos positivos elimina.
- Forma de la caída. Un tránsito planetario tiene bordes relativamente abruptos y fondo plano; un eclipse rasante da una forma más redondeada, en uve.
Ninguna de las cuatro es concluyente por separado. Un modelo bien construido las pondera en conjunto, y ahí gana claramente a una secuencia de reglas con umbrales fijos, porque la evidencia se acumula en lugar de descartarse en el primer filtro.
Validar no es confirmar
Esta distinción se difumina en las noticias y es la que más importa para leer bien cualquier anuncio.
| Nivel | Qué se hace | Qué se obtiene | Qué queda sin saber |
|---|---|---|---|
| Candidato | señal periódica que supera el umbral | un evento en un catálogo | si es un planeta |
| Validado | se estima la probabilidad de cada escenario alternativo | una probabilidad de falso positivo muy baja | la masa y la densidad |
| Confirmado | medida dinámica: velocidad radial o variaciones de tiempo | masa, y con el radio, densidad | composición detallada |
La validación estadística es un cálculo de probabilidades: se enumeran los escenarios astrofísicos que podrían producir esa señal y se estima cuál es su frecuencia esperada dado lo que se sabe del campo, del brillo de la estrella y de las comprobaciones realizadas. Si la probabilidad de que sea otra cosa cae por debajo de un umbral, se declara validado.
Es un procedimiento legítimo y es lo que ha permitido dar por buenos miles de planetas cuyas estrellas son demasiado débiles para medir velocidades radiales. También es un procedimiento que depende de suposiciones sobre la población estelar del entorno, y ha habido casos de objetos validados que revisiones posteriores devolvieron a la lista de candidatos.
La confirmación exige una medida independiente que dé masa. Sin masa no hay densidad, y sin densidad no se puede decir si un objeto de radio terrestre es una bola de roca o una pequeña envoltura de gas alrededor de un núcleo pequeño. Esa es la razón por la que los telescopios grandes en tierra siguen siendo imprescindibles pese a que el descubrimiento se haga desde el espacio.
El sesgo que se hereda del catálogo
Cualquier catálogo de planetas conocidos está profundamente sesgado, y no por descuido: por física. Los planetas grandes producen caídas profundas y los de periodo corto se repiten muchas veces en una campaña, así que ambas clases están sobrerrepresentadas en todo lo que se ha confirmado.
Entrenar con ese catálogo transmite el sesgo al modelo. Un clasificador aprende que la señal típica de un planeta tiene cierta profundidad, cierta duración y cierta relación con el brillo de la anfitriona, y puntúa peor lo que se aparta de ese patrón, aunque sea igual de real.
La consecuencia para la ciencia de poblaciones es seria. Si se quiere medir qué fracción de estrellas tiene planetas de un tamaño y un periodo dados, hace falta conocer con precisión la eficiencia de detección del sistema completo en cada rincón del espacio de parámetros. Con una cadena de reglas explícitas eso se calculaba analizando cada regla; con una red entrenada hay que medirlo empíricamente, inyectando señales artificiales y contando cuántas se recuperan.
Ese trabajo de caracterización es tedioso, se publica menos y es exactamente lo que separa un catálogo de descubrimientos de un catálogo utilizable para estadística. Sin él, cualquier conclusión sobre la abundancia de planetas rocosos arrastra una incertidumbre que no aparece en las barras de error.
Lo que encuentran las personas y no encuentra el algoritmo
Hay un contraejemplo que se cita siempre y que merece la pena entender bien. Un proyecto de ciencia ciudadana puso las curvas de luz del cartografiado a disposición de voluntarios para que las inspeccionaran visualmente, con la idea de complementar la búsqueda automática.
Entre lo que encontraron había una estrella con caídas de brillo profundas, irregulares, sin periodo reconocible y con formas que no se parecían a nada catalogado. Ningún algoritmo de búsqueda de tránsitos la habría marcado, porque no buscaba eso. Sigue siendo objeto de estudio y ha generado una literatura considerable.
El mismo proyecto y otros equivalentes han identificado sistemas de periodo largo a partir de tránsitos aislados, precisamente el punto ciego descrito antes. La inspección visual humana es lenta y no escala, y a cambio no tiene un modelo previo de lo que espera encontrar.
La lección operativa no es que las personas sean mejores clasificando, porque no lo son en volumen ni en consistencia. Es que la clasificación automática está optimizada para una hipótesis concreta, y todo lo que cae fuera de esa hipótesis necesita otra vía. Los proyectos de participación abierta cumplen esa función, y de paso son una de las mejores puertas de entrada para quienes se acercan por primera vez a la disciplina.
Qué comprobación humana sigue siendo obligatoria
Ninguna publicación seria presenta hoy una lista de planetas salida directamente de un modelo. La revisión posterior tiene un contenido concreto y bastante repetitivo.
- Inspección visual de cada candidato relevante. Mirar la curva plegada, la curva completa y el diagnóstico de centroide, buscando artefactos que el modelo no haya visto.
- Cruce con catálogos de imagen de alta resolución. Comprobar si hay compañeras estelares cercanas que diluyan la señal y alteren el radio deducido.
- Coincidencia de efemérides. Verificar que el periodo y la fase no coinciden con los de una binaria conocida en un píxel vecino, un origen de falsos positivos muy común.
- Revisión del registro instrumental. Contrastar las fechas de los tránsitos con incidencias del telescopio, maniobras o cambios de configuración.
- Seguimiento desde tierra. Fotometría con mayor resolución espacial para confirmar en qué estrella ocurre realmente la caída, y espectroscopía cuando el brillo lo permita.
La cuarta comprobación es la que más candidatos elimina en la práctica y la que menos aparece en las descripciones del método. Una parte apreciable de las señales que superan todos los filtros estadísticos son artefactos correlacionados con la operación del instrumento, y ningún modelo entrenado sobre curvas de luz tiene acceso a ese contexto.
Preguntas frecuentes
¿Cuántos planetas se han encontrado así?
El total de exoplanetas conocidos supera los cinco mil, y la gran mayoría procede del método de tránsitos. La fracción atribuible específicamente a clasificadores entrenados es de varios cientos de objetos validados, más un número indeterminado de candidatos priorizados que después se confirmaron por otras vías.
¿Sustituyen los modelos al análisis clásico?
No. La búsqueda de periodicidades sigue haciéndose con algoritmos deterministas, la validación estadística usa marcos bayesianos explícitos y la confirmación exige medidas dinámicas. El modelo entrenado ocupa un tramo concreto de la cadena: el cribado de eventos, donde el volumen hace inviable la revisión manual.
¿Puede un modelo inventarse un planeta?
Puede asignar una probabilidad alta a una señal que no lo es, que es la forma realista del problema. Por eso ninguna validación se apoya solo en la salida del clasificador: se combina con el cálculo de probabilidad de falso positivo, con las comprobaciones instrumentales y, cuando es posible, con seguimiento independiente.
¿Sirve el mismo modelo para telescopios distintos?
Mal. Cada instrumento tiene su cadencia, su tamaño de píxel, su nivel de mezcla de luz entre estrellas vecinas y sus artefactos característicos. Un modelo entrenado con datos de una misión se degrada al aplicarlo a otra, y lo habitual es reutilizar la arquitectura y reentrenar desde cero con datos propios.
¿Qué pasa con los planetas que no transitan?
Se detectan por otros métodos, principalmente por el bamboleo que inducen en su estrella y, cada vez más, por astrometría de precisión desde el espacio. Son poblaciones complementarias: los tránsitos favorecen órbitas cortas y alineadas, y los métodos dinámicos favorecen planetas masivos. Combinarlas es la única forma de acercarse a un censo sin sesgo.
Un clasificador bien entrenado extrae de un archivo público planetas que llevaban años ahí sin que nadie los viera. El mismo clasificador, aplicado sin caracterizar su eficiencia, produce un catálogo que parece completo y no lo es. Las dos cosas son ciertas a la vez, y separar una de otra es hoy el trabajo más útil del campo. La NASA y la Agencia Espacial Europea mantienen archivos abiertos con todas estas curvas de luz.