La inteligencia artificial no empezó con ChatGPT. No empezó con Claude, Gemini, los agentes de programación, los generadores de imágenes ni la actual carrera hacia la AGI.

El campo académico de la IA se remonta a décadas atrás. Pero la IA que hoy domina el mundo — grandes modelos de lenguaje, sistemas multimodales, asistentes de programación, laboratorios de frontera y herramientas agénticas — tiene un origen más concreto. Y esa historia no va solo de algoritmos. Va de personas, instituciones, artículos, infraestructura y culturas de investigación que permitieron que ideas raras se volvieran fundacionales.

Va de Andrew Dai y Quoc V. Le explorando el preentrenamiento y el ajuste fino antes de que ese patrón fuera el estándar del sector. Va de Ilya Sutskever, Oriol Vinyals y Quoc Le ayudando a establecer el aprendizaje secuencia a secuencia. Va del artículo del transformador, donde investigadores de Google presentaron la arquitectura que después haría funcionar los grandes modelos de lenguaje modernos. Y va también de Jeff Dean, Geoffrey Hinton, la infraestructura a escala de Google y una cultura de investigación que dio a gente poco convencional la libertad suficiente para probar ideas antes de que nadie supiera cuáles importarían.

Y cada vez más, va de lo que viene después: razonamiento visual, inteligencia del mundo físico y la pregunta de si los modelos de lenguaje por sí solos bastan para llegar a la AGI. La versión corta: la IA moderna nació de la convergencia de cuatro fuerzas — el modelado del lenguaje como base de la comprensión; arquitecturas transformadoras capaces de escalar; datos y cómputo a escala de la web; y una concentración poco común de talento investigador, sobre todo en Google Brain. Pero la siguiente fase puede exigir una quinta fuerza: modelos capaces de entender el mundo visual y físico de forma nativa.

Buena parte de este enfoque procede de una entrevista con Andrew Dai, antiguo investigador de Google Brain y DeepMind, en el pódcast Inside the Silicon Mind. Las afirmaciones factuales que siguen se han contrastado con los artículos de investigación originales y con la cobertura periodística; las fuentes están al final.

Por qué importa Google Brain

Google Brain no fue el único sitio que importó en la IA moderna. DeepMind, FAIR, OpenAI, laboratorios académicos y muchos investigadores independientes moldearon el campo. Cualquier historia seria tiene que decirlo con claridad. Pero Google Brain ocupa un lugar especial porque combinó tres cosas que rara vez coexisten: libertad de investigación sin agenda cerrada, infraestructura de aprendizaje automático de primer nivel y una densidad de talento extrema.

Esa combinación es la razón por la que Andrew Dai, al repasar sus años dentro de Google Brain, lo describió como una especie de Bell Labs de la era de la IA. La comparación no dice que Google Brain lo inventara todo — Bell Labs tampoco inventó todo. La comparación va de concentración: un lugar donde la investigación fundacional, la ambición de ingeniería y los productos futuros estaban lo bastante cerca como para influirse entre sí.

En el relato de Dai, la cultura importó tanto como la tecnología. Los investigadores podían pensar con libertad. Podían probar ideas sin la presión inmediata del producto. Podían hablar de investigación en las cocinas de la oficina y durante la comida. Podían equivocarse delante de colegas brillantes sin que se les castigara por ello. Eso no es un detalle blando; es el centro de la historia. En la investigación de frontera, la mayoría de las ideas fracasan. Una cultura que castiga el fracaso produce trabajo cauteloso. Una cultura que combina exigencia alta con permiso para equivocarse crea las condiciones de los avances.

La intuición de 2015: el preentrenamiento antes de que fuera obvio

Uno de los momentos clave del nacimiento de la IA moderna llegó en 2015, cuando Andrew M. Dai y Quoc V. Le publicaron su trabajo sobre aprendizaje secuencial semisupervisado. La idea básica hoy suena familiar: entrenar un modelo en una tarea amplia con datos sin etiquetar y luego ajustarlo para una tarea supervisada más concreta. En aquel momento, ese no era todavía el camino principal evidente.

Dai y Le usaron redes neuronales recurrentes, en concreto LSTM, porque los transformadores aún no existían. Entrenaron modelos para predecir qué viene a continuación en una secuencia — en esencia, un objetivo de modelado del lenguaje — y después los ajustaron en tareas posteriores como el análisis de sentimiento. La lección importante no fue solo que el método funcionara. Fue por qué funcionaba.

Un modelo de lenguaje no está aprendiendo simplemente a adivinar palabras. Para predecir bien el lenguaje, tiene que absorber gramática, estilo, sentimiento, hechos, relaciones y estructura oculta. Tiene que comprimir los patrones del mundo tal como se expresan en el texto. Esto se convirtió en una de las intuiciones centrales de la IA moderna: el modelado del lenguaje puede ser una vía hacia el aprendizaje de representaciones de propósito general. Esa idea después se volvió normal. Pero en 2015 todavía era un hallazgo de investigación.

Verificado. «Semi-supervised Sequence Learning», de Dai y Le, se publicó en 2015 (arXiv:1511.01432) y apareció en NeurIPS ese mismo año. Se cita ampliamente como una demostración temprana del patrón preentrenar y luego ajustar.

Secuencia a secuencia: la base anterior

El trabajo de preentrenamiento de 2015 no salió de la nada. Un año antes, Ilya Sutskever, Oriol Vinyals y Quoc V. Le publicaron su trabajo sobre aprendizaje secuencia a secuencia con redes neuronales. Aquel artículo mostró que las redes neuronales podían mapear una secuencia a otra: una frase en otra frase, un idioma en otro idioma, una entrada estructurada en una salida estructurada.

Eso importó para la traducción. Pero importó también de forma más amplia, porque ayudó a establecer un patrón que hoy está debajo de muchos sistemas de IA: coger una entrada, codificarla, transformarla y generar una salida útil. La traducción, el resumen, la respuesta a preguntas, el chat, la generación de código y las trazas de razonamiento pueden entenderse en buena medida como descendientes de esa mentalidad secuencia a secuencia. La era de la IA moderna no salió de un solo artículo. Salió de una cadena de artículos, experimentos e intuiciones que empezaron a reforzarse entre sí — un linaje que trazamos en nuestra cronología de avances en IA.

El transformador: la máquina que faltaba

El transformador cambió la escala del juego. El artículo de 2017 Attention Is All You Need propuso una arquitectura nueva basada en mecanismos de atención, prescindiendo de la recurrencia y la convolución. Eso hizo el modelado de secuencias mucho más paralelizable y mucho más fácil de escalar.

Importó porque el preentrenamiento por sí solo no bastaba. Las LSTM podían demostrar el principio, pero los transformadores lo volvieron industrial. La fórmula pasó a ser fácil de describir y extremadamente difícil de ejecutar: entrenar un transformador grande con datos masivos usando un objetivo de modelado del lenguaje y después adaptarlo mediante ajuste fino, ajuste por instrucciones, aprendizaje por refuerzo u otros métodos de postentrenamiento. Esa fórmula sostiene hoy buena parte del auge de la IA.

GPT-1 mostró la potencia del preentrenamiento generativo para la comprensión del lenguaje. GPT-2 mostró que los modelos de lenguaje entrenados con texto de la web podían empezar a realizar tareas a partir de demostraciones que aparecían de forma natural. El trabajo sobre leyes de escalado mostró después que el rendimiento podía mejorar de forma predecible con más parámetros, datos y cómputo. Trabajos posteriores como Chinchilla afinaron la relación entre el tamaño del modelo y los datos de entrenamiento. Cuando llegó ChatGPT, el público vio un producto repentino. Pero el camino técnico profundo llevaba años formándose.

El triángulo: objetivo, arquitectura, datos

El enfoque de Andrew Dai es útil porque reduce el nacimiento de los LLM modernos a un triángulo: el transformador, el objetivo de modelado del lenguaje y los datos a escala de la web. El transformador aportó la maquinaria. El objetivo aportó la señal de entrenamiento. La web aportó el combustible. El cómputo hizo que el triángulo se moviera más deprisa.

Pero incluso ese triángulo técnico está incompleto. Seguía necesitando gente con el criterio para notar qué ideas importaban, la infraestructura para probarlas y la cultura para dejarlas crecer. Ahí es donde el papel de Google Brain deja de ser una nota al pie.

Jeff Dean y la infraestructura de la ambición

La importancia de Jeff Dean en esta historia es en parte técnica y en parte cultural. La IA moderna no es solo matemática ingeniosa. Es ingeniería de sistemas a escala extrema. Requiere entrenamiento distribuido, conjuntos de datos enormes, aceleradores, infraestructura, velocidad experimental y la capacidad de convertir ideas de investigación en sistemas entrenables.

Un laboratorio sin infraestructura puede escribir artículos. Un laboratorio con infraestructura puede comprobar si las ideas escalan. Google Brain tenía esa ventaja: combinaba investigación abierta en aprendizaje automático con infraestructura de cómputo a escala de Google. Eso significaba que los investigadores podían explorar ideas imposibles en un entorno académico más pequeño. Por eso la infraestructura no está separada de la inteligencia. En la IA moderna, la infraestructura moldea lo que los investigadores son capaces de imaginar.

Geoffrey Hinton y la filosofía inspirada en el cerebro

La influencia de Geoffrey Hinton fue distinta. Su aportación no fue solo un artículo o una técnica concreta. Fue una filosofía: el cerebro humano sigue siendo el único ejemplo funcional de inteligencia general que tenemos, así que los sistemas artificiales deberían aprender de ese ejemplo.

No copiando la biología al pie de la letra. Las neuronas artificiales son mucho más simples que las reales, y no está nada claro que la retropropagación sea lo que hace el cerebro humano. Pero la creencia de fondo era potente: construir sistemas de aprendizaje generales, exponerlos a los datos adecuados y dejar que la optimización descubra representaciones internas útiles. Esa visión ayudó a alejar la IA de las reglas escritas a mano y acercarla a las representaciones aprendidas. La IA anterior intentaba a menudo codificar la inteligencia de forma explícita. La IA moderna intenta cultivar comportamiento útil mediante el entrenamiento. Ese es uno de los grandes giros del campo.

La diáspora de Google Brain

Una de las consecuencias más importantes de Google Brain no fue un modelo concreto. Fue la gente que se marchó. Muchos nombres que hoy definen la IA de frontera pasaron por Google Brain, DeepMind o el ecosistema de investigación de Google en sentido amplio.

  • Dario Amodei trabajó en Google Brain antes de OpenAI y más tarde fue cofundador y consejero delegado de Anthropic.
  • Ilya Sutskever trabajó en Google, cofundó OpenAI y después fundó Safe Superintelligence.
  • David Ha dirigió el equipo de investigación de Google Brain en Japón y pasó a ser cofundador y consejero delegado de Sakana AI.
  • Liam Fedus trabajó en Google Brain y OpenAI antes de cofundar Periodic Labs, una empresa de ciencia de materiales, con el antiguo investigador de Google Brain Ekin Doğuş Çubuk.
  • Sara Hooker trabajó en Google Brain y después dirigió el laboratorio de investigación sin ánimo de lucro Cohere For AI.
  • Andrew Dai pasó cerca de 14 años en Google, más de una década de ellos entre Google Brain y DeepMind, antes de cofundar Elorian — un laboratorio de razonamiento visual que levantó unos 55 millones de dólares, con respaldo que según la prensa incluye a Nvidia y a Jeff Dean.

Por eso se compara la red de Google Brain con la Mafia de PayPal. La analogía es imperfecta, pero útil. La cuestión no es que todos vinieran de una sola empresa. La cuestión es que las redes densas y tempranas pueden moldear un sector durante décadas. Google Brain produjo ideas. También produjo fundadores.

Por qué los laboratorios de frontera no se construyeron todos dentro de Google

Esto plantea una pregunta obvia. Si Google Brain tenía el talento, la cultura y la infraestructura, ¿por qué OpenAI, Anthropic, Safe Superintelligence, Sakana, Periodic Labs, Elorian y otros proyectos de frontera no se construyeron sin más dentro de Google?

La respuesta es en parte organizativa. Las grandes empresas son sitios excelentes para aprender, reunir recursos y trabajar con gente extraordinaria. Pero también traen presión de producto, política interna, escaleras de promoción, competencia interna y limitaciones estratégicas. Para algunos investigadores, marcharse no fue un rechazo a Google Brain. Fue la siguiente etapa del efecto Google Brain. El laboratorio había entrenado a la gente para pensar más a lo grande. Con el tiempo, algunas de esas personas quisieron más control, más foco y menos ataduras institucionales. Las ideas se movieron porque se movió la gente.

Seguridad psicológica y ósmosis

Dos ideas culturales de la entrevista de Dai merecen atención especial: la seguridad psicológica y la ósmosis. La seguridad psicológica significa que los investigadores podían enseñar ideas sin terminar, admitir incertidumbre, cuestionarse entre ellos y equivocarse sin destruir su estatus.

La ósmosis significa que la gente aprendía por estar cerca de colegas de élite. Absorbían criterio investigador. Aprendían cuándo abandonar un proyecto y cuándo seguir empujando. Escuchaban cómo los investigadores veteranos planteaban los problemas. Veían la ambición de cerca. Eso es difícil de reproducir en un entorno completamente remoto o muy burocrático. Una videollamada agendada puede transmitir información. Es peor creando colisiones accidentales entre ideas. Muchas conversaciones de investigación importantes ocurren antes de que nadie sepa que son importantes. Esa es una de las razones por las que el nacimiento de la IA moderna fue tan social como técnico.

¿Fue Google Brain el único lugar de nacimiento de la IA moderna?

No. Una historia más sólida no debe exagerar. Google Brain fue central, pero no estuvo solo. DeepMind aportó aprendizaje por refuerzo, IA científica, AlphaGo, AlphaFold, Gemini y trabajo importante sobre escalado y multimodalidad. OpenAI empujó la línea GPT hasta la conciencia pública. FAIR aportó investigación abierta y modelos relevantes. Los laboratorios académicos desarrollaron muchos de los métodos, referencias y teoría subyacentes.

Así que la afirmación correcta no es «Google Brain inventó la IA moderna». La afirmación correcta es: «Google Brain fue uno de los lugares de nacimiento más densos de la IA moderna, porque combinó las intuiciones sobre preentrenamiento, la investigación de la era del transformador, la infraestructura y una red de talento que después sembró los laboratorios de frontera». Eso es a la vez más exacto y más creíble.

¿Ya estamos en la AGI?

La respuesta de Dai es, en esencia, no. Su argumento no es que los modelos de lenguaje sean poco impresionantes — más bien lo contrario. En texto, código y algunas tareas abstractas, los sistemas de IA actuales ya son extremadamente potentes. Pero buena parte de la economía real no es texto.

Las empresas trabajan con planos, esquemas eléctricos, sistemas de cableado, modelos CAD, motores, obras, imágenes médicas, explotaciones agrícolas, robots, infraestructura y centros de datos. Son problemas visuales, espaciales y físicos. Un modelo que escribe buen código pero no entiende de forma fiable qué dos cosas conecta un cable todavía no es general en el sentido que la industria necesita.

Este es el problema de la «visión de bebé». Los sistemas multimodales actuales saben describir imágenes, pero siguen teniendo dificultades con el razonamiento visual preciso: contar, relaciones espaciales, permanencia del objeto, diagramas, oclusión, rotación, restricciones físicas e intención de diseño. Las pruebas recientes concretan la brecha — trabajos como BabyVision y VisuLogic encuentran que los principales modelos multimodales puntúan muy por debajo de la referencia humana en tareas visuales básicas. Eso importa porque la próxima ola de IA puede depender menos de producir mejor texto y más de entender el mundo que hay detrás del texto.

¿Hacia dónde vamos? La siguiente fase de la IA

La primera fase de la IA moderna fue centrada en el lenguaje. Tenía sentido. El lenguaje es abundante, está digitalizado, es comprimible y está profundamente conectado con el conocimiento humano. La web dio a los investigadores un conjunto de entrenamiento enorme. Los transformadores les dieron una arquitectura escalable. El modelado del lenguaje les dio un objetivo simple.

La siguiente fase puede ser física y visual. Eso significa sistemas de IA que no se limiten a poner pie a las imágenes, sino que razonen directamente a través de la información visual — sistemas capaces de entender diagramas, distribuciones espaciales, restricciones físicas, conjuntos mecánicos, planos de ingeniería, tareas de robótica y causa y efecto en el mundo real. Ahí es donde apuntan empresas como Elorian: razonamiento visual nativo. El cambio se puede resumir así:

  • Primera ola: modelos que leen y escriben
  • Segunda ola: modelos que ven y describen
  • Próxima ola: modelos que ven, razonan, diseñan y actúan

Esto conecta con una tendencia más amplia en torno a los modelos visión-lenguaje-acción en robótica: sistemas que toman observaciones visuales e instrucciones en lenguaje y generan acciones en el mundo físico. Eso no significa que mañana haya robots en todas partes. Significa que la frontera de la investigación se está moviendo de «la IA como máquina de texto» hacia «la IA como modelo del mundo».

Por qué el razonamiento visual puede importar más que otro chatbot

Otro chatbot puede ser útil. Pero el razonamiento visual y físico podría abrir dominios mucho más grandes. Si los modelos pueden razonar visualmente, se vuelven más útiles en arquitectura, ingeniería, fabricación, robótica, construcción, aeroespacial, agricultura, medicina, diseño de centros de datos y descubrimiento científico.

No son casos de uso «que estaría bien tener». Son el lugar donde vive buena parte de la economía física. Un modelo capaz de leer un esquema de cableado, entender una pieza de máquina, identificar un cuello de botella físico, razonar sobre un plano o ayudar a diseñar infraestructura está operando en otra categoría distinta a la de un chatbot. Por eso el «próximo nacimiento» de la IA puede no parecerse a un modelo de texto más grande. Puede parecerse a un modelo que por fin entienda la estructura visual y la restricción física.

El mejor marco: la IA no deja de nacer

La expresión «el nacimiento de la IA» puede confundir si sugiere un único momento. Hubo un nacimiento original de la IA como campo académico en el siglo XX. Hubo un nacimiento del aprendizaje profundo como paradigma dominante. Hubo un nacimiento de los LLM modernos a través del preentrenamiento, los transformadores, los datos de la web y la escala. Ahora puede haber otro nacimiento: el de la IA visual y del mundo físico.

Este marco evita una falsa historia de origen único. Nos permite decir algo más exacto: la IA ha tenido varios nacimientos. El que estamos viviendo empezó con el lenguaje. El siguiente puede empezar con la visión. Esa es una tesis mejor que decir simplemente «Google Brain creó la IA».

Preguntas frecuentes

¿Google Brain inventó la IA moderna?

No. Google Brain fue uno de los lugares de nacimiento más densos de la IA moderna, pero no el único. DeepMind, OpenAI, FAIR, los laboratorios académicos y muchos otros también hicieron aportaciones importantes.

¿Por qué es importante Andrew Dai en esta historia?

Andrew Dai firmó con Quoc V. Le el artículo de 2015 sobre aprendizaje secuencial semisupervisado, pasó años en Google Brain y DeepMind, y después cofundó Elorian, una empresa centrada en el razonamiento visual.

¿Cuál fue el avance de preentrenamiento de 2015?

Dai y Le demostraron que entrenar modelos de secuencia con datos sin etiquetar y luego ajustarlos en tareas supervisadas podía mejorar el rendimiento. Eso anticipó el patrón de preentrenar y después adaptar que más tarde fue central en los LLM modernos.

¿Por qué importaron los transformadores?

Los transformadores hicieron el modelado de secuencias a gran escala más paralelizable y escalable que los enfoques recurrentes anteriores. Combinados con objetivos de modelado del lenguaje, datos a escala de la web y cómputo, se convirtieron en la arquitectura central de los LLM modernos.

¿Qué es la diáspora de Google Brain?

Se refiere a la red de investigadores que pasaron por Google Brain, DeepMind o el ecosistema de investigación de Google en sentido amplio y después ayudaron a construir o dirigir laboratorios de frontera y startups como OpenAI, Anthropic, Safe Superintelligence, Sakana AI, Periodic Labs y Elorian.

¿Qué es la «visión de bebé»?

La «visión de bebé» es la idea de que incluso los modelos multimodales potentes siguen teniendo dificultades con tareas básicas de razonamiento visual y espacial que los niños pequeños resuelven. Es una forma útil de nombrar la distancia entre la inteligencia lingüística y la comprensión del mundo físico.

¿Es el razonamiento visual la siguiente fase de la IA?

Puede ser una de las próximas grandes fronteras. Los modelos de texto y código ya son sólidos, pero muchos sectores del mundo real dependen del razonamiento visual, espacial y físico. Modelos capaces de entender diagramas, diseños, objetos y restricciones podrían abrir nuevos dominios para la IA.

La historia humana detrás de la máquina

El público suele ver el producto: ChatGPT, Gemini, Claude, Midjourney, Copilot, agentes. La historia profunda es más difícil de ver. Son artículos, conversaciones en la cocina de la oficina, experimentos fallidos, infraestructura de cómputo, contrataciones poco convencionales, seguridad psicológica y un grupo de investigadores aprendiendo unos de otros por ósmosis.

Andrew Dai y Quoc Le vieron que el modelado del lenguaje podía ser una base para la comprensión. Ilya Sutskever, Oriol Vinyals y Quoc Le ayudaron a establecer el aprendizaje secuencia a secuencia. Los autores del transformador dieron al campo la arquitectura que necesitaba para escalar. Geoffrey Hinton aportó una filosofía de representación aprendida inspirada en el cerebro. Jeff Dean ayudó a crear la infraestructura y la cultura de sistemas que permitieron escalar la investigación. Gente como Dario Amodei, Sara Hooker, David Ha, Liam Fedus, Ilya Sutskever y Andrew Dai llevó piezas de esa cultura a la siguiente generación de laboratorios de IA.

Incluso Isaac Asimov pertenece al borde de la historia, por la recomendación que hace Dai de la serie Fundación. Asimov escribió sobre arcos largos de la historia, causas ocultas y pequeños grupos de personas moldeando futuros enormes. La historia de la IA tiene algo de esa forma. La IA moderna no nació de un invento. Nació de la convergencia de personas, ideas, arquitectura, datos, cómputo y cultura.

Y si la siguiente fase es la inteligencia visual y del mundo físico, la pregunta no es solo qué modelo gana. La pregunta de fondo es: ¿dónde está el próximo Google Brain? ¿Dónde está el próximo lugar que combine densidad de talento, infraestructura, libertad, seguridad psicológica y paciencia para los problemas difíciles? Ahí es donde puede nacer la próxima IA.

Fuentes y lecturas adicionales