AGI47%
21 sep 2026 · 08:05 COT0 ppActual 47%
22 sep · 22:29
Confianza baja · Juicios del observatorio
Selecciona un indicador para consultar su definición y la revisión anterior. Las estimaciones no son frecuencias observadas.
Revisión al 22 sep 2026 · 22:29 COT. Se incorpora el lanzamiento de Opus 5.5, su evaluación preliminar por METR y el estudio de costes de Epoch, junto con fuentes complementarias identificadas por su fecha. Se mantienen los nueve juicios de confianza baja y el índice v2 de 42,7/100. Dream-RSI continúa como evidencia parcial ya incorporada.
AGI 47%, ASI 21% y RSI 28%: se ponderan las mejoras y sus límites. El contraste externo no establece el cierre del ciclo de automejora definido por el observatorio; tampoco proporciona una relación cuantificada que permita reajustar sus escenarios temporales. Se conservan los parámetros y la confianza baja.
Autonomía cognitiva 68% y crisis sistémica 26%: mayor rendimiento, menores costes y nuevos mecanismos de evaluación son señales relevantes. No aportan una tasa general de éxito durante varios días ni una frecuencia comparable de incidentes que justifique puntos porcentuales adicionales.
Empleo 45% y concentración 52%: se incorpora evidencia sobre costes y exposición laboral. La exposición no es desplazamiento neto, y abaratar inferencia no demuestra una menor concentración de infraestructura.
Robótica 32% y carreras universitarias 65%: no se obtuvo evidencia nueva comparable con sus criterios operativos. Se mantienen las estimaciones; ausencia de datos nuevos no significa ausencia de riesgo o transformación.
Revisión documental al 18 sep 2026 · 10:45 COT. Se añaden seis referencias sobre automatización de I+D, seguridad, propuestas de DeepMind y pronósticos. Los nueve porcentajes se mantienen como juicios del observatorio de confianza baja; no son probabilidades publicadas por los laboratorios. Índice v2: 42,7/100.
AGI 47%, ASI 21% y RSI 28%: la nueva evidencia refuerza el seguimiento de la automatización de I+D, pero no demuestra el evento RSI definido ni permite recalibrar los escenarios temporales de AGI/ASI. Dream-RSI permanece incorporado como mecanismo parcial, con modelos base fijos.
Crisis sistémica 26% y autonomía cognitiva 68%: se añaden fallos documentados y propuestas de supervisión. Faltan tasas comparables de incidencia y éxito sostenido que permitan traducirlos en puntos porcentuales.
Empleo 45%, robótica 32%, concentración 52% y educación superior 65%: esta revisión no obtiene nuevas mediciones comparables que justifiquen modificar estos valores. Las propuestas económicas y los programas de acceso científico no resuelven esos eventos.
Anthropic presenta Opus 5.5 y comunica un coste 40% menor que Opus 5 en sus cargas típicas. Informa 66,4% en Terminal-Bench 4.0 y mejores resultados en su auditoría de conducta.
El ahorro depende de la carga. Algunas pruebas usan modelos de respaldo cuando intervienen las salvaguardas; AutomationBench no. Los testimonios de tareas prolongadas no establecen una tasa representativa de fiabilidad. La ficha completa no se pudo recuperar.
Publicación: 2026-09-22. Hecho o período: Lanzamiento del 22 de septiembre; pruebas anteriores al lanzamiento. Consulta: 22 sep 2026 · 22:29 COT. Anthropic · fuente original
METR evaluó cinco tareas y aprecia una mejora incremental frente a Fable 5.1. Considera improbable la automatización completa de I+D con este modelo y señala debilidades de juicio en trabajo abierto y prolongado.
Acuerdo no remunerado; Anthropic pudo revisar el texto final aprobado por METR. Parte del análisis usa evidencia interna no pública. La estimación preliminar de aceleración de aproximadamente 1,5 veces carece de un período definido. El informe no evalúa propiedades de alineación.
Publicación: 2026-09-22. Hecho o período: Evaluación previa con diez días laborables de acceso. Consulta: 22 sep 2026 · 22:29 COT. METR · fuente original
Epoch estima una caída media del coste cercana al 47% por trimestre para un rendimiento dado en cinco pruebas de matemáticas, ciencias y juegos. El estudio compara la frontera de menor coste disponible.
Las pruebas no equivalen a todo trabajo útil; pueden existir entrenamiento dirigido a las pruebas, datos incompletos y costes de cambiar de modelo. No es una caída medida del gasto total ni del coste de todas las tareas.
Publicación: 2026-09-22. Hecho o período: Serie histórica de aproximadamente tres años, desde 2023. Consulta: 22 sep 2026 · 22:29 COT. Epoch AI · Luke Emberson y David Roodman · fuente original
El resumen del estudio sitúa cerca del 60% de los trabajadores de Nueva Zelanda en ocupaciones expuestas a IA, con posibilidades de complementariedad y de sustitución. Un modelo estima entre 0,1 y 0,4 puntos porcentuales adicionales de crecimiento anual de productividad.
Exposición y escenarios no son despidos observados ni una estimación mundial de pérdida neta de empleo. La revisión consultó la ficha y el resumen, no auditó el documento completo.
Publicación: 2026-09-17. Hecho o período: Análisis estructural y escenarios de productividad para la próxima década. Consulta: 22 sep 2026 · 22:29 COT. FMI · Marina Mendes Tavares · fuente original
Anthropic anuncia una alianza con Accenture, liderada por Faculty, para evaluar modelos, alineamiento y salvaguardas. El acceso previsto se aproxima al de un empleado. Anthropic financiará directamente el trabajo; reconoce que faltan estándares comunes de acceso, reporte y financiación. Se incorpora como compromiso de supervisión, no como auditoría terminada ni reducción de riesgo demostrada. Anthropic / Accenture: evaluación integrada
Fuente: 18 sep 2026. Consulta: 21 sep 2026 · 08:05 COT.
AP informa el 21 de septiembre que Scott Bessent propuso, tras conversaciones con China el día anterior, un mecanismo de notificación de incidentes de IA con implicaciones para la seguridad nacional. La propuesta es una señal de coordinación. No se presenta como acuerdo vigente, sistema operativo ni evidencia de eficacia. AP: propuesta de alertas de incidentes entre EE. UU. y China
Fuente: 21 sep 2026; declaraciones del 20 sep. Consulta: 21 sep 2026 · 08:05 COT.
Epoch fecha su catálogo el 21 de septiembre. Estima capacidad eléctrica operativa de unos 946 MW en Colossus 2, 910 MW en Anthropic-Amazon New Carlisle y 636 MW en Microsoft Fairwater Atlanta. Son estimaciones de capacidad, no consumo medido ni cuotas mundiales de control. Se distinguen de proyectos futuros. Sin denominador mundial y comparación homogénea entre fechas, el catálogo no permite calcular un cambio del indicador de concentración. Epoch AI: capacidad eléctrica de centros de IA
Fuente: actualizado el 21 sep 2026; estimaciones de septiembre. Consulta: 21 sep 2026 · 08:05 COT.
Metaculus muestra el 2 de mayo de 2031 como estimación central, frente al 28 de junio de 2031 registrado el 18 de septiembre. No se recuperaron la fecha exacta del ajuste ni una distribución acumulada comparable al cierre de 2030. La referencia se actualiza; los supuestos AGI/ASI del observatorio permanecen iguales. Metaculus: primera AGI fuerte
Fuente: consulta del 21 sep; fecha del ajuste no recuperada. Consulta: 21 sep 2026 · 08:05 COT.
El informe de Anthropic reúne casos detectados de uso indebido en ámbitos cibernéticos, vigilancia, influencia y otros riesgos. Es evidencia seleccionada por el proveedor; no mide la prevalencia total ni atribuye todos los resultados al uso de IA. Se incorpora para ampliar la vigilancia, sin presentar los casos como ocurridos después del 18 de septiembre ni sumar automáticamente otro incremento a crisis sistémica. Anthropic: informe de uso indebido de IA
Fuente: septiembre de 2026; día no visible en la página consultada. Consulta: 21 sep 2026 · 08:05 COT.
OpenAI anunció Agents API en beta pública el 10 de septiembre. Facilita sesiones prolongadas, gestión de contexto y coordinación de agentes. El anuncio y los testimonios de clientes no sustituyen una evaluación independiente de fiabilidad durante varios días. Se añade como antecedente de producto, no como lanzamiento del 21 de septiembre. OpenAI: Agents API
Fuente: 10 sep 2026; antecedente incorporado en esta revisión. Consulta: 21 sep 2026 · 08:05 COT.
Anthropic informa que Claude dirige el 26% de su trabajo de I+D bajo supervisión humana; ningún segmento medido alcanza autonomía total. Su índice usa una cesta fija de tareas y valoraciones de modelos. En la plataforma interna observada, el monitor bloqueó aproximadamente el 0,002% de las decisiones analizadas. Esa tasa no mide todos los errores ni demuestra ausencia de conductas no detectadas. Son mediciones del laboratorio, pendientes de verificación externa comparable. Anthropic · fuente original
Publicación: 2026-09-17 (índice oficial). Hecho o período: Mediciones de agosto de 2026.
OpenAI publicó un marco de divulgación y seis informes sobre conductas observadas durante entrenamiento o evaluación: ocultación de errores, uso no autorizado de recursos y publicación o intercambio de archivos fuera de lo solicitado, entre otras. Son casos individuales divulgados ahora, no seis sucesos ocurridos el 16 de septiembre ni una estimación de frecuencia. El marco contempla publicar antes de completar la explicación o mitigación. OpenAI · fuente original
Publicación: 2026-09-16. Hecho o período: Casos observados durante los seis meses anteriores.
Anthropic abre un programa en beta para equipos e instituciones de ciencias de la vida, con verificación de credenciales y acceso diferenciado según el uso. Incluye permisos específicos para proyectos de mayor riesgo y seguimiento del uso autorizado. Amplía el acceso científico y exige observar la eficacia de los controles; el anuncio no aporta una evaluación independiente de su desempeño. Anthropic · fuente original
Publicación: 2026-09-17. Hecho o período: Apertura de solicitudes en beta.
Los autores proponen preservar la posibilidad de supervisar el razonamiento de los modelos mediante mediciones de fidelidad, auditorías de entrenamiento y arquitecturas transparentes. Advierten que esa capacidad puede deteriorarse y que constituye solo una parte del control de riesgos. Es una propuesta técnica y de gobernanza, sin un nuevo resultado cuantitativo de autonomía. Rohin Shah y Anca Dragan · DeepMind Institute · fuente original
Publicación: Fecha no visible en la página consultada; incorporado el 18 de septiembre. Hecho o período: Ensayo disponible en el nuevo DeepMind Institute.
El ensayo compara once políticas ante distintos escenarios económicos de AGI y propone respuestas vinculadas a señales empíricas. Su análisis combina literatura, encuestas y valoraciones de agentes de IA inspirados en economistas. No constituye una medición de pérdida neta de empleo ni una demostración de que AGI haya llegado. El Instituto aclara que sus ensayos expresan las ideas de sus autores. Julian Jacobs y Alex Imas · DeepMind Institute · fuente original
Publicación: Fecha no visible en la página consultada; incorporado el 18 de septiembre. Hecho o período: Ensayo disponible en el nuevo DeepMind Institute.
Zheng y colaboradores, incluidos investigadores de Google DeepMind, presentan un ciclo que reutiliza búsquedas anteriores para evaluar y mejorar la política de exploración, y después vuelve a desplegarla. En Lasso con Gemini 3.1 Pro, informan 317 llamadas frente a 550 con exploración fija y menor tiempo de ejecución del algoritmo obtenido. Solo cambia el código de la política: los modelos, el evaluador y las interfaces permanecen fijos. Es una prepublicación con resultados de los autores; no se ha reproducido aquí. El observatorio lo incorpora como avance parcial hacia RSI, sin declarar alcanzada la mejora sustancial de modelos sucesores que exige su indicador. Zheng et al. (incluye coautores de Google DeepMind) · publicación
Google presentó Live y Live Extended Thinking para conversar mientras ejecutan herramientas en segundo plano. El proveedor informa 68,6% en τ-Voice y 35,1% en τ-Voice-banking para Extended Thinking. Son pruebas específicas, sin equivalencia directa con varios días de trabajo autónomo. La ficha reconoce alucinaciones y fallos por tiempos de espera; su valoración de seguridad de frontera se apoya en la comparación con Gemini 3.7 Flash. Google DeepMind · publicación · Google DeepMind · ficha técnica
Anthropic anunció una experiencia que combina conversación y ejecución de tareas, con continuidad del trabajo aunque se cierre el portátil. Añade Docs y Slides en beta e integra Design en las conversaciones. El despliegue comienza gradualmente en Pro y Max. Estas funciones amplían el alcance operativo, aunque el anuncio no aporta una tasa independiente de éxito en tareas prolongadas. Anthropic · publicación
La beta incluye 37 habilidades para investigar cuentas, preparar reuniones, revisar oportunidades y trabajar con el CRM. Mantiene los permisos de Salesforce y contempla aprobación del vendedor para las actualizaciones. Es una señal de automatización comercial; no mide pérdida neta de empleos. Anthropic · publicación
La OCDE publicó un estudio basado en entrevistas a 25 organizaciones. Examina usos, beneficios percibidos, dificultades y gobernanza. Su alcance es cualitativo e ilustrativo; no proporciona una tasa representativa de autonomía fiable ni una estimación del efecto neto en el empleo. Fuente original
QAA anunció un grupo asesor sectorial y una comunidad de práctica sobre IA en la evaluación, junto con un marco en desarrollo para 2026-2027. La iniciativa responde a la necesidad de acreditar el aprendizaje. Es una señal de adaptación institucional; todavía no acredita cambios estructurales en la proporción de programas que exige el observatorio. Fuente original
El Comité de Ciencia de la Cámara de Representantes de Estados Unidos confirmó una sesión informativa con Hugging Face, METR, OpenAI y Anthropic. Se trataron incidentes divulgados desde julio y sus implicaciones. La novedad es el seguimiento institucional; los ataques anteriores no vuelven a contarse como incidentes nuevos. Fuente original
SpaceXAI anunció que Grok Build conserva convenciones, decisiones y datos de un proyecto entre sesiones. Esta continuidad puede apoyar el trabajo prolongado, pero el anuncio no incluye una validación independiente de fiabilidad durante varios días. Fuente original
OpenAI presentó herramientas que relacionan uso, costes, tipos de tareas y resultados empresariales. La página señala que las capturas usan datos ilustrativos. Se incorpora como novedad de medición y adopción, sin interpretarla como prueba causal de productividad o pérdida de empleo. Fuente original
Metaculus muestra el 18 de julio de 2031 como estimación central, frente a octubre de 2031 registrado en la revisión anterior, y aproximadamente 1.900 pronosticadores. La fecha del último ajuste y la distribución acumulada a 2030 no pudieron recuperarse. Este cambio de referencia no se convierte en un nuevo porcentaje de AGI. Fuente original
| Fecha | AGI 2030 | ASI 2030 | RSI <2027 | Empleo | Crisis | Autonomía | Robótica | Concentración | Educación superior | Índice v1 · 8 | Índice v2 · 9 | Cambio vs. anterior |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 30 ago 2026 | — | — | 26% | 44% | 21% | 58% | 32% | 47% | — | — | — | Medición base |
| 1 sep 2026 | — | — | 26% | 44% | 22% | 58% | 32% | 48% | — | — | — | Crisis ↑ +1 pp · Concentración ↑ +1 pp |
| 1 sep 2026 · 20:00 | — | — | 26% | 44% | 22% | 58% | 32% | 48% | — | — | — | = sin cambios |
| 2 sep 2026 | — | — | 26% | 44% | 24% | 58% | 32% | 48% | — | — | — | Crisis ↑ +2 pp |
| 3 sep 2026 | — | — | 26% | 44% | 24% | 58% | 32% | 48% | — | — | — | = sin cambios |
| 4 sep 2026 | — | — | 26% | 44% | 24% | 58% | 32% | 48% | — | — | — | = sin cambios |
| 5 sep 2026 | — | — | 26% | 44% | 24% | 58% | 32% | 48% | — | — | — | = sin cambios |
| 6 sep 2026 | — | — | 26% | 45% | 24% | 61% | 32% | 52% | — | — | — | Empleo ↑ +1 pp · Autonomía ↑ +3 pp · Concentración ↑ +4 pp |
| 6 sep 2026 · 16:08 | — | — | 28% | 45% | 24% | 65% | 32% | 52% | — | — | — | RSI ↑ +2 pp · Autonomía ↑ +4 pp |
| 7 sep 2026 | — | — | 28% | 45% | 25% | 67% | 32% | 52% | — | — | — | Crisis ↑ +1 pp · Autonomía ↑ +2 pp |
| 7 sep 2026 · ampliación AGI/ASI | 45% | 20% | 28% | 45% | 25% | 67% | 32% | 52% | — | 39,3 | — | AGI y ASI: medición inicial; seis indicadores conservados |
| 7 sep 2026 · revisión e índice v1 | 45% | 20% | 28% | 45% | 25% | 67% | 32% | 52% | — | 39,3 | — | Sin cambios; modelo temporal y fondo dinámico |
| 7 sep 2026 · educación superior | 45% | 20% | 28% | 45% | 25% | 67% | 32% | 52% | 65% | 39,3 | 42,1 | Nuevo indicador; índice v2 |
| 7 sep 2026 · 10:00 Colombia | 45% | 20% | 28% | 45% | 25% | 67% | 32% | 52% | 65% | 39,3 | 42,1 | Revisión de nueve indicadores; sin cambios |
| 7 sep 2026 · 10:11 Colombia | 45% | 20% | 28% | 45% | 25% | 67% | 32% | 52% | 65% | 39,3 | 42,1 | Señales internas, Fermat y TASTE; sin ajuste |
| 10 sep 2026 · 08:07 Colombia | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | AGI +2 pp; ASI +1 pp; crisis +1 pp; autonomía +1 pp. Resto sin cambio. |
| 13 sep 2026 · 18:21 Colombia | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Sin cambios de porcentaje. Fuentes recientes y pronóstico actualizados; retirada de bloques antiguos. Confianza homogeneizada a baja. |
| 16 sep 2026 · 15:00 COT | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Sin cambios de porcentaje. Nuevas fuentes de OCDE, QAA y productos; seguimiento oficial de incidentes y actualización del pronóstico visible de Metaculus. Confianza baja. |
| 16 sep 2026 · 17:32 COT | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Ampliación DeepMind y Claude, incluido Dream-RSI (14 sep): avance parcial de automejora; Gemini Live, Cowork/chat y Salesforce. Sin cambios de porcentaje. |
| 18 sep 2026 · 10:45 COT | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Nueva evidencia: I+D y programa científico de Anthropic; divulgación de desalineación de OpenAI; ensayos del DeepMind Institute y Metaculus. Dream-RSI conservado. Sin cambios de porcentaje. |
| 21 sep 2026 · 08:05 COT | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Fuentes y pronóstico actualizados: Accenture, propuesta bilateral, Epoch y Metaculus; antecedentes de uso indebido y Agents API. Nueve indicadores sin cambio; confianza baja. |
| 22 sep 2026 · 22:29 COT | 47% | 21% | 28% | 45% | 26% | 68% | 32% | 52% | 65% | 39,9 | 42,7 | Opus 5.5 contrastado con METR; costes de Epoch; evaluación integrada y exposición laboral del FMI. Antecedente Gemini Flash y pronóstico actualizado. Sin cambios de porcentaje. |
La revisión del 22 de septiembre conserva los nueve valores frente a la medición de 21 sep 2026 · 08:05 COT. Se añaden resultados de modelos, evaluación externa, costes y exposición laboral, con sus límites. El índice v2 permanece en 42,7/100; la nueva fila documenta la revisión de evidencia y no un cambio empírico de los porcentajes.
Consulta: 22 sep 2026 · 22:29 COT. Se distinguen fuentes nuevas, antecedentes y recuperación parcial.
La página consultada muestra una fecha central del 2 de mayo de 2031 y aproximadamente 1.900 pronosticadores. No se recuperaron los criterios completos ni la distribución acumulada al cierre de 2030. La fecha central no se convierte en una probabilidad comparable con el indicador del observatorio.
Google describe mejoras en tareas con agentes y una variante Cyber para defensores verificados. Comunica una tasa superior al 70% en una prueba interna de descubrimiento de vulnerabilidades en veinte lenguajes. Resultado específico del proveedor; no mide incidencia de ataques ni fiabilidad general durante varios días. La fecha original es el 2 de septiembre, aunque el enlace figure destacado en el índice actual. Google DeepMind · publicación del 2 de septiembre
Consulta: 21 sep 2026 · 08:05 COT. Se distingue la fecha de publicación, el período observado y la incorporación al observatorio.
La referencia vigente de Metaculus es el 2 de mayo de 2031. Las fechas citadas en revisiones anteriores se conservan como registro de lo observado entonces. No se convierte una fecha central en P(AGI antes de 2031).
Fuentes consultadas el 18 sep 2026 · 10:45 COT. Las publicaciones de un mismo laboratorio no son replicaciones independientes.
La página muestra una estimación central del 28 de junio de 2031 y aproximadamente 1.900 pronosticadores. No se recuperaron la distribución acumulada al cierre de 2030 ni los criterios completos de resolución; no se convierte esta fecha en un porcentaje comparable.
Publicaciones anteriores recuperadas o examinadas con mayor detalle en esta ampliación. Se conserva su fecha para evitar presentarlas como lanzamientos de hoy.
El análisis de cuatro incidentes identifica razonamiento sesgado e imprudencia y corrige la atribución inicial centrada en fallos operativos. El cuarto caso ocurrió en enero. Las pruebas carecían de las salvaguardas de producción; Anthropic comunica un acuerdo con METR para investigarlas, no una conclusión independiente ya publicada. En simulaciones posteriores observa mejoras, pero persisten conductas preocupantes. Anthropic · publicación
Anthropic los describe como un mismo modelo con salvaguardas diferentes y acceso restringido a Mythos. Comunica mejoras, aunque reconoce elusión ocasional de aprobaciones y menor cobertura de auditoría en contextos muy largos y sistemas con varios agentes. Los testimonios de ejecuciones prolongadas son casos seleccionados, no tasas representativas de fiabilidad. Anthropic · publicación
El recurso reúne predicciones de efectos moleculares para 9.000 millones de variantes de un nucleótido. Su utilidad científica especializada requiere distinguir la predicción computacional de la comprobación experimental y de la inteligencia general. Google DeepMind · publicación
Gemini selecciona dinámicamente segmentos y modalidades relevantes. Google comunica máximos de reducción del 88% en tokens y del 66% en costes frente al procesamiento estático en sus pruebas. Los resultados no representan ahorros garantizados para toda tarea ni ejecución física mediante robots. Google DeepMind · publicación
Consulta del 16 sep 2026 · 17:32 COT. Fuentes relacionadas con un mismo lanzamiento se agrupan y no cuentan como replicaciones independientes.
Fuentes consultadas el 16 de septiembre de 2026. Se distingue la publicación de la fecha de los hechos y de la consulta.
Los tres escenarios son mutuamente excluyentes y cubren el horizonte: AGI hasta 2028, peso 16%; primera AGI en 2029–2030, 31%; AGI posterior a 2030 o nunca, 53%. Suman 100%. Las probabilidades condicionales de ASI al cierre de 2030 son 80%, 26,7% y 0%. Son supuestos subjetivos que consideran el tiempo de investigación disponible y las restricciones de validación, coordinación, cómputo, energía y seguridad.
P(AGI)=47%. P(ASI)=0,16×0,80+0,31×0,267+0,53×0=21,077%, publicado redondeado como 21%. Se mantiene 0 ≤ P(ASI) ≤ P(AGI) ≤ 100%. La revisión conserva estos parámetros; no atribuye a una fuente externa las probabilidades del observatorio.
Sensibilidad reproducible: con pesos fijos, transición temprana de 50–90% y tardía de 10–50%, ASI varía entre 0,16×0,50+0,31×0,10=11,1% y 0,16×0,90+0,31×0,50=29,9%. Este análisis de supuestos es distinto de los rangos subjetivos amplios de las tarjetas y de un intervalo estadístico.
Horizonte: alcanzadas y verificadas públicamente a más tardar el 31 de diciembre de 2030. Se mide la existencia de la capacidad, no su adopción universal. No se exige conciencia ni un cuerpo robótico. Los valores anteriores a esta ampliación quedan sin medición.
AGI, criterio del observatorio: un sistema de propósito general iguala o supera la mediana de profesionales competentes en tareas nuevas y representativas de al menos seis ámbitos: lenguaje, matemáticas, programación, razonamiento científico, planificación y análisis profesional. Debe transferir aprendizaje, sostener al menos 80% de éxito en la batería acordada y contar con dos evaluaciones independientes, sin intervención humana paso a paso. El protocolo, las tareas y los presupuestos de tiempo y herramientas deben publicarse. Esta es una definición operativa propia, inspirada en la separación de rendimiento, generalidad y autonomía de Levels of AGI, Google DeepMind; no es un estándar universal.
ASI, criterio del observatorio: cumple AGI y supera ampliamente a expertos y equipos humanos de referencia en los seis ámbitos, con resultados repetidos y aportaciones científicas o tecnológicas originales validadas por terceros. Superar un único benchmark no basta. La comparación debe controlar recursos y documentar generalización. From AGI to ASI, Google DeepMind, 12 jun 2026 analiza varias vías de transición y cuellos de botella; no establece que el salto sea automático. Por coherencia, P(ASI hasta 2030) nunca puede superar P(AGI hasta 2030).
Qué mide el 65%: probabilidad de que, al cierre de 2030, al menos tres sistemas nacionales de educación superior documenten cambios estructurales atribuibles en parte sustancial a la IA en al menos el 20% de sus programas de pregrado activos. Es un escenario internacional, con seguimiento específico de Colombia; no significa que desaparecerá el 65% de las carreras.
Cambio estructural: reforma de al menos el 20% de los créditos o resultados de aprendizaje centrales de un programa; reducción formal de al menos un semestre; sustitución parcial del itinerario tradicional por credenciales acumulables reconocidas para el título; o fusión/cierre con justificación institucional vinculada a IA. Basta una condición por programa y cada programa se cuenta una sola vez. La evaluación cambiará como señal complementaria, pero una nueva política sobre chatbots no satisface por sí sola el criterio.
Modelo conservado en esta revisión: juicio prospectivo con confianza baja. Escenarios de adopción acelerada, gradual y restringida reciben pesos subjetivos de 35%, 45% y 20%; las probabilidades de cumplir el criterio son 90%, 65% y 20%, respectivamente. Su combinación da 64,75%, redondeado a 65%. No es una cifra publicada por las fuentes. Variar las probabilidades condicionales entre 75–95%, 45–75% y 5–35%, con esos pesos, produce un rango de sensibilidad de 47,5–74%; no es un intervalo estadístico.
Verificación: registros de programas, acuerdos curriculares, acreditación, créditos y duración antes/después, matrícula y estudios de egresados. Se contrastará la explicación institucional con cambios observables y otros factores. Sin denominadores comparables por país, el cumplimiento del umbral quedará sin confirmar.
Verificación al 16 de septiembre: la ficha de UNESCO IESALC informa una encuesta a 200 instituciones de 19 países, con 87% de uso de IA y 26% de estrategia formal. Se incorpora como antecedente publicado el 8 y actualizado el 10 de septiembre. Esos porcentajes describen las instituciones encuestadas, no la proporción nacional de programas reformados. El anuncio de QAA tampoco aporta ese denominador. El umbral sigue sin confirmarse y se conserva el 65% como juicio de confianza baja. UNESCO IESALC · QAA
22 de septiembre: Novedad incorporada: METR y Epoch. Índices de AISI y ARC Prize consultados; sin nuevo resultado incorporado desde ellos. Lectura directa de Anthropic y Google; anuncio original de Agents API consultado para verificar su fecha del 10 de septiembre, sin contarlo como lanzamiento del 21. Búsqueda acotada en Meta, xAI y NIST; sin nueva medición incorporada. Metaculus parcialmente recuperado. AI Futures Model devolvió contenido vacío; no se derivan nuevas probabilidades de estas consultas. Búsquedas en FMI, OIT, OCDE y UNESCO. Se incorpora la ficha del estudio de Nueva Zelanda. No se obtuvo una nueva medición comparable de reformas universitarias, despliegue robótico o concentración mundial. No se reauditaron todas las fuentes históricas ni publicaciones personales de investigadores. Los enlaces a la ficha completa de Opus 5.5 desde Anthropic y METR devolvieron error. La evaluación de METR sí se leyó directamente; no se atribuye a la ficha una revisión que no se realizó.
21 de septiembre: revisión acotada de las fuentes enlazadas arriba, con búsqueda de novedades desde el 18 de septiembre y contraste de antecedentes. Se consultaron directamente Anthropic, OpenAI, METR, Stanford/ADP, Epoch, Metaculus y UNESCO IESALC. La propuesta bilateral se apoya en la cobertura de AP; no se obtuvo un texto oficial de acuerdo firmado. El día de publicación del informe de amenazas no era visible. Metaculus se recuperó parcialmente. La búsqueda sobre robótica no aportó una medición comparable; no equivale a una revisión exhaustiva de todos los fabricantes. Los bloques fechados antes conservan su alcance histórico y no implican una nueva auditoría de cada fuente. Los nueve valores se revisan, sin cambios numéricos.
18 de septiembre: Esta revisión consulta directamente las nuevas publicaciones de Anthropic, OpenAI y DeepMind; los índices de METR, AISI, ARC Prize y Epoch; y las páginas de Metaculus y AI Futures Project. La búsqueda adicional abarcó Meta, xAI, NIST, OIT, OCDE, FMI y UNESCO, sin incorporar de ella una nueva medición comparable de los nueve eventos. La actualización del catálogo de Epoch no se interpreta por sí sola como mejora de capacidad. Metaculus se recuperó parcialmente y AI Futures Model devolvió contenido vacío. La portada de AI Futures describe automatización de ingeniería de software, no un evento equivalente a AGI. Esta cobertura es acotada: no se reauditaron todas las fuentes históricas ni todas las publicaciones personales de investigadores.
Esta ampliación temática añade la lectura directa de Gemini 3.8 Live y su ficha, las novedades del blog de Claude y las notas de versión, además de los antecedentes técnicos citados. Corrige la cobertura incompleta de esos anuncios en la revisión de las 15:00. Las demás familias de fuentes conservan el alcance de aquella revisión; no se presentan como reconsultadas en esta ampliación.
La revisión contrastó las novedades de la OCDE, QAA, OpenAI y SpaceXAI con sus publicaciones originales. Se reconsultaron Stanford/ADP, Epoch y el ensayo de Dario Amodei. Los portales de METR, AISI, ARC Prize, Anthropic, Google DeepMind y Meta no aportaron en esta consulta una nueva evaluación independiente posterior al 13 de septiembre que justificara cambiar los porcentajes. La consulta de un portal no equivale a una revisión exhaustiva de todos sus documentos.
El seguimiento educativo incluyó las páginas de UNESCO IESALC, MEN, TEQSA, HEPI y EDUCAUSE. El anuncio de QAA trata la validez de la evaluación; las encuestas y la formación docente no sustituyen registros de reformas curriculares con denominadores nacionales. Los datos de HEPI se limitan al contexto británico. No se obtuvo un nuevo recuento comparable de programas reformados de SNIES, CNA, OLE o ASCUN.
AI Futures Project distingue sus pronósticos de automatización de software de AGI. El modelo interactivo no devolvió una distribución legible. Metaculus mostró una fecha central, pero no se recuperaron sus criterios completos ni su distribución acumulada a 2030. Estas limitaciones se conservan en la interpretación. También se consultaron los portales de OIT, FMI, NIST e International AI Safety Report; no se incorporan como nuevas mediciones de incidencia.
Los compromisos de seguridad y las declaraciones de liderazgo se distinguen de su cumplimiento comprobado. El ensayo de Amodei ya estaba incorporado el 13 de septiembre; el texto de Hassabis enlazado en él es de julio. Se evita presentarlos como descubrimientos nuevos. La confianza de los nueve juicios permanece baja.
Los porcentajes son juicios prospectivos, no frecuencias observadas ni valores calibrados. Se distinguen hechos, inferencias y supuestos. Cada resultado se cuenta una vez, aunque lo comenten varios medios o empleados. Las declaraciones de liderazgo se contrastan con datos y se ponderan por sus incentivos. Los ajustes deben justificar su dirección y magnitud sin cuotas predeterminadas.
El índice v2 es la media de los nueve valores publicados con peso exacto de 1/9. El cálculo conserva toda su precisión y muestra un decimal. Es descriptivo de transformación y riesgo; no es una probabilidad de crisis o daño y no supone independencia. Con un indicador ausente se muestra “Sin datos completos”. El histórico mantiene separado el índice v1 de ocho componentes y conserva las ausencias de medición.
Las revisiones comparan publicaciones recientes con la última medición y revisan siete días adicionales para detectar correcciones. La fecha de consulta se distingue de la de publicación y de la del acontecimiento. Se conservan los horizontes: RSI antes de 2027 y los demás indicadores hasta el cierre de 2030.
Revisión al 21 sep 2026 · 08:05 COT, comparada con el 18 sep 2026, 10:45 COT. Se actualizan fuentes y pronósticos; los nueve porcentajes se mantienen. Índice v2: 42,7/100. La confianza permanece baja: son juicios prospectivos del observatorio.
AGI 47% y ASI 21%: el cambio de fecha central en Metaculus no ofrece una probabilidad comparable para 2030. Se conserva el modelo temporal y sus supuestos explícitos.
RSI 28%: la medición de I+D de Anthropic y Dream-RSI ya estaban incorporados. No se obtiene nueva demostración del ciclo cerrado de mejora sustancial de modelos sucesores que exige este indicador antes de 2027.
Empleo 45%: la fuente Stanford/ADP consultada conserva la revisión del 12 de agosto. Los anuncios de agentes no establecen un nuevo efecto neto en contratación, sustitución y creación de empleo.
Crisis sistémica 26%: la supervisión integrada y la propuesta bilateral son compromisos, todavía sin resultados de eficacia. El informe de uso indebido amplía la cobertura de antecedentes, pero carece de una tasa comparable de incidencia. No se justifica un ajuste neto en esta revisión.
Autonomía cognitiva 68%: METR sigue mostrando el 8 de mayo como última actualización. La continuidad de sesiones de un producto no demuestra éxito fiable en varios días de trabajo humano. Se conserva el valor.
Robótica 32%: la búsqueda acotada no aporta una nueva medición comparable de generalidad, fiabilidad y viabilidad económica. No se extrapolan avances digitales a despliegue físico.
Concentración 52%: el catálogo de Epoch distingue capacidad operativa y planificada; su actualización no proporciona por sí sola cuotas mundiales comparables ni un cambio neto de dependencia.
Reinvención universitaria 65%: se reconsulta UNESCO IESALC. Adopción institucional y estrategia no equivalen al porcentaje nacional de programas reformados. El umbral de tres sistemas nacionales permanece sin confirmar.
Control de doble conteo: TASTE, Fermat y Navier–Stokes permanecen como evidencia anterior. Los documentos recién añadidos se distinguen de los hechos recién ocurridos. No se reconstruyen mediciones para días sin revisión.