A inteligência artificial não começou com o ChatGPT. Não começou com o Claude, o Gemini, os agentes de programação, os geradores de imagem nem com a atual corrida rumo à AGI.

O campo acadêmico da IA remonta a décadas atrás. Mas a IA que hoje domina o mundo — grandes modelos de linguagem, sistemas multimodais, assistentes de programação, laboratórios de fronteira e ferramentas agênticas — tem uma origem mais específica. E essa história não é só sobre algoritmos. É sobre pessoas, instituições, artigos, infraestrutura e culturas de pesquisa que permitiram que ideias estranhas virassem fundacionais.

É sobre Andrew Dai e Quoc V. Le explorando o pré-treinamento e o ajuste fino antes de esse padrão virar o padrão do setor. É sobre Ilya Sutskever, Oriol Vinyals e Quoc Le ajudando a estabelecer o aprendizado sequência a sequência. É sobre o artigo do transformador, em que pesquisadores do Google apresentaram a arquitetura que depois faria funcionar os grandes modelos de linguagem modernos. E é também sobre Jeff Dean, Geoffrey Hinton, a infraestrutura em escala Google e uma cultura de pesquisa que deu a gente pouco convencional liberdade suficiente para testar ideias antes de alguém saber quais delas importariam.

E, cada vez mais, é sobre o que vem depois: raciocínio visual, inteligência do mundo físico e a pergunta sobre se os modelos de linguagem sozinhos bastam para chegar à AGI. A versão curta: a IA moderna nasceu da convergência de quatro forças — a modelagem de linguagem como base da compreensão; arquiteturas transformadoras capazes de escalar; dados e computação em escala da web; e uma concentração rara de talento de pesquisa, sobretudo no Google Brain. Mas a próxima fase pode exigir uma quinta força: modelos capazes de entender o mundo visual e físico de forma nativa.

Boa parte desse enquadramento vem de uma entrevista com Andrew Dai, ex-pesquisador do Google Brain e da DeepMind, no podcast Inside the Silicon Mind. As afirmações factuais a seguir foram checadas contra os artigos de pesquisa originais e a cobertura jornalística; as fontes estão no final.

Por que o Google Brain importa

O Google Brain não foi o único lugar que importou na IA moderna. DeepMind, FAIR, OpenAI, laboratórios acadêmicos e muitos pesquisadores independentes moldaram a área. Qualquer história séria precisa dizer isso com clareza. Mas o Google Brain ocupa um lugar especial porque combinou três coisas que raramente coexistem: liberdade de pesquisa sem agenda fechada, infraestrutura de aprendizado de máquina de primeira linha e uma densidade extrema de talento.

É essa combinação que levou Andrew Dai, ao rever seus anos dentro do Google Brain, a descrevê-lo como uma espécie de Bell Labs da era da IA. A comparação não diz que o Google Brain inventou tudo — a Bell Labs também não inventou tudo. A comparação é sobre concentração: um lugar em que a pesquisa fundacional, a ambição de engenharia e os produtos futuros estavam próximos o bastante para se influenciarem.

No relato de Dai, a cultura importou tanto quanto a tecnologia. Os pesquisadores podiam pensar livremente. Podiam testar ideias sem pressão imediata de produto. Podiam discutir pesquisa nas copas do escritório e no almoço. Podiam errar diante de colegas brilhantes sem serem punidos por isso. Isso não é um detalhe fofo; é o centro da história. Na pesquisa de fronteira, a maioria das ideias fracassa. Uma cultura que pune o fracasso produz trabalho cauteloso. Uma cultura que junta exigência alta com permissão para errar cria as condições dos avanços.

A intuição de 2015: o pré-treinamento antes de ser óbvio

Um dos momentos-chave do nascimento da IA moderna veio em 2015, quando Andrew M. Dai e Quoc V. Le publicaram o trabalho sobre aprendizado sequencial semissupervisionado. A ideia básica hoje soa familiar: treinar um modelo em uma tarefa ampla com dados não rotulados e depois ajustá-lo para uma tarefa supervisionada mais específica. Na época, esse ainda não era o caminho principal evidente.

Dai e Le usaram redes neurais recorrentes, especificamente LSTMs, porque os transformadores ainda não existiam. Treinaram modelos para prever o que vem em seguida em uma sequência — em essência, um objetivo de modelagem de linguagem — e depois os ajustaram em tarefas posteriores, como análise de sentimento. A lição importante não foi só que o método funcionava. Foi por que funcionava.

Um modelo de linguagem não está apenas aprendendo a adivinhar palavras. Para prever bem a linguagem, ele precisa absorver gramática, estilo, sentimento, fatos, relações e estrutura oculta. Precisa comprimir os padrões do mundo tal como aparecem no texto. Isso virou uma das intuições centrais da IA moderna: a modelagem de linguagem pode ser um caminho para o aprendizado de representações de propósito geral. Essa ideia depois virou normal. Mas, em 2015, ainda era uma descoberta de pesquisa.

Verificado. O artigo “Semi-supervised Sequence Learning”, de Dai e Le, foi publicado em 2015 (arXiv:1511.01432) e apareceu no NeurIPS no mesmo ano. É amplamente citado como uma demonstração inicial do padrão pré-treinar e depois ajustar.

Sequência a sequência: a base anterior

O trabalho de pré-treinamento de 2015 não surgiu do nada. Um ano antes, Ilya Sutskever, Oriol Vinyals e Quoc V. Le publicaram o trabalho sobre aprendizado sequência a sequência com redes neurais. Aquele artigo mostrou que redes neurais conseguiam mapear uma sequência em outra: uma frase em outra frase, um idioma em outro idioma, uma entrada estruturada em uma saída estruturada.

Isso importou para a tradução. Mas importou também de forma mais ampla, porque ajudou a estabelecer um padrão que hoje está por baixo de muitos sistemas de IA: pegar uma entrada, codificá-la, transformá-la e gerar uma saída útil. Tradução, resumo, resposta a perguntas, chat, geração de código e traços de raciocínio podem, em boa medida, ser entendidos como descendentes dessa mentalidade sequência a sequência. A era da IA moderna não veio de um artigo só. Veio de uma cadeia de artigos, experimentos e intuições que começaram a se reforçar mutuamente — uma linhagem que traçamos na nossa linha do tempo de avanços em IA.

O transformador: a máquina que faltava

O transformador mudou a escala do jogo. O artigo de 2017 Attention Is All You Need propôs uma arquitetura nova baseada em mecanismos de atenção, dispensando recorrência e convolução. Isso tornou a modelagem de sequências muito mais paralelizável e muito mais fácil de escalar.

Isso importou porque o pré-treinamento sozinho não bastava. As LSTMs conseguiam demonstrar o princípio, mas os transformadores o tornaram industrial. A fórmula ficou fácil de descrever e extremamente difícil de executar: treinar um transformador grande com dados massivos usando um objetivo de modelagem de linguagem e depois adaptá-lo por ajuste fino, ajuste por instruções, aprendizado por reforço ou outros métodos de pós-treinamento. Essa fórmula sustenta hoje boa parte do boom da IA.

O GPT-1 mostrou a força do pré-treinamento generativo para a compreensão de linguagem. O GPT-2 mostrou que modelos de linguagem treinados com texto da web podiam começar a executar tarefas a partir de demonstrações que surgiam naturalmente. O trabalho sobre leis de escala mostrou depois que o desempenho podia melhorar de forma previsível com mais parâmetros, dados e computação. Trabalhos posteriores como o Chinchilla refinaram a relação entre tamanho do modelo e dados de treino. Quando o ChatGPT chegou, o público viu um produto repentino. Mas o caminho técnico mais profundo vinha se formando havia anos.

O triângulo: objetivo, arquitetura, dados

O enquadramento de Andrew Dai é útil porque reduz o nascimento dos LLMs modernos a um triângulo: o transformador, o objetivo de modelagem de linguagem e os dados em escala da web. O transformador deu a maquinaria. O objetivo deu o sinal de treino. A web deu o combustível. A computação fez o triângulo andar mais depressa.

Mas até esse triângulo técnico está incompleto. Ele ainda precisava de gente com o discernimento para notar quais ideias importavam, da infraestrutura para testá-las e da cultura para deixá-las crescer. É aí que o papel do Google Brain deixa de ser uma nota de rodapé.

Jeff Dean e a infraestrutura da ambição

A importância de Jeff Dean nesta história é em parte técnica e em parte cultural. A IA moderna não é só matemática engenhosa. É engenharia de sistemas em escala extrema. Exige treino distribuído, conjuntos de dados enormes, aceleradores, infraestrutura, velocidade experimental e a capacidade de transformar ideias de pesquisa em sistemas treináveis.

Um laboratório sem infraestrutura consegue escrever artigos. Um laboratório com infraestrutura consegue testar se as ideias escalam. O Google Brain tinha essa vantagem: combinava pesquisa aberta em aprendizado de máquina com infraestrutura de computação em escala Google. Isso significava que os pesquisadores podiam explorar ideias impossíveis em um ambiente acadêmico menor. Por isso a infraestrutura não é separada da inteligência. Na IA moderna, a infraestrutura molda o que os pesquisadores conseguem imaginar.

Geoffrey Hinton e a filosofia inspirada no cérebro

A influência de Geoffrey Hinton foi diferente. A contribuição dele não foi só um artigo ou uma técnica específica. Foi uma filosofia: o cérebro humano continua sendo o único exemplo funcional de inteligência geral que temos, então os sistemas artificiais deveriam aprender com esse exemplo.

Não copiando a biologia ao pé da letra. Os neurônios artificiais são muito mais simples que os reais, e não está nada claro que a retropropagação seja o que o cérebro humano faz. Mas a crença de fundo era poderosa: construir sistemas de aprendizado gerais, expô-los aos dados certos e deixar a otimização descobrir representações internas úteis. Essa visão ajudou a afastar a IA das regras escritas à mão e a aproximá-la das representações aprendidas. A IA anterior muitas vezes tentava codificar a inteligência de forma explícita. A IA moderna tenta cultivar comportamento útil por meio do treino. Essa é uma das grandes viradas da área.

A diáspora do Google Brain

Uma das consequências mais importantes do Google Brain não foi um modelo específico. Foram as pessoas que saíram. Muitos nomes que hoje definem a IA de fronteira passaram pelo Google Brain, pela DeepMind ou pelo ecossistema de pesquisa do Google em sentido amplo.

  • Dario Amodei trabalhou no Google Brain antes da OpenAI e depois virou cofundador e presidente-executivo da Anthropic.
  • Ilya Sutskever trabalhou no Google, cofundou a OpenAI e depois fundou a Safe Superintelligence.
  • David Ha liderou a equipe de pesquisa do Google Brain no Japão e virou cofundador e presidente-executivo da Sakana AI.
  • Liam Fedus trabalhou no Google Brain e na OpenAI antes de cofundar a Periodic Labs, uma startup de ciência dos materiais, com o ex-pesquisador do Google Brain Ekin Doğuş Çubuk.
  • Sara Hooker trabalhou no Google Brain e depois liderou o laboratório de pesquisa sem fins lucrativos Cohere For AI.
  • Andrew Dai passou quase 14 anos no Google, mais de uma década deles entre Google Brain e DeepMind, antes de cofundar a Elorian — um laboratório de raciocínio visual que levantou cerca de 55 milhões de dólares, com apoio que, segundo a imprensa, inclui a Nvidia e o próprio Jeff Dean.

É por isso que se compara a rede do Google Brain à Máfia do PayPal. A analogia é imperfeita, mas útil. A questão não é que todo mundo tenha vindo de uma empresa só. A questão é que redes densas e precoces podem moldar um setor por décadas. O Google Brain produziu ideias. Produziu também fundadores.

Por que os laboratórios de fronteira não foram todos construídos dentro do Google

Isso levanta uma pergunta óbvia. Se o Google Brain tinha o talento, a cultura e a infraestrutura, por que a OpenAI, a Anthropic, a Safe Superintelligence, a Sakana, a Periodic Labs, a Elorian e outros projetos de fronteira não foram simplesmente construídos dentro do Google?

A resposta é em parte organizacional. Grandes empresas são lugares excelentes para aprender, reunir recursos e trabalhar com gente extraordinária. Mas também trazem pressão de produto, política interna, escadas de promoção, competição interna e restrições estratégicas. Para alguns pesquisadores, sair não foi uma rejeição ao Google Brain. Foi o estágio seguinte do efeito Google Brain. O laboratório tinha treinado as pessoas a pensar maior. Com o tempo, algumas dessas pessoas quiseram mais controle, mais foco e menos amarras institucionais. As ideias se moveram porque as pessoas se moveram.

Segurança psicológica e osmose

Duas ideias culturais da entrevista de Dai merecem atenção especial: segurança psicológica e osmose. Segurança psicológica quer dizer que os pesquisadores podiam mostrar ideias inacabadas, admitir incerteza, se questionar mutuamente e errar sem destruir o próprio status.

Osmose quer dizer que as pessoas aprendiam por estar perto de colegas de elite. Absorviam discernimento de pesquisa. Aprendiam quando abandonar um projeto e quando continuar insistindo. Ouviam como os pesquisadores mais experientes formulavam os problemas. Viam a ambição de perto. Isso é difícil de reproduzir em um ambiente totalmente remoto ou muito burocrático. Uma videochamada agendada transmite informação. É pior para criar colisões acidentais entre ideias. Muitas conversas de pesquisa importantes acontecem antes de alguém saber que são importantes. Essa é uma das razões pelas quais o nascimento da IA moderna foi tão social quanto técnico.

O Google Brain foi o único berço da IA moderna?

Não. Uma história mais sólida não deve exagerar. O Google Brain foi central, mas não estava sozinho. A DeepMind contribuiu com aprendizado por reforço, IA científica, AlphaGo, AlphaFold, Gemini e trabalho importante sobre escala e multimodalidade. A OpenAI levou a linha GPT à consciência pública. A FAIR contribuiu com pesquisa aberta e modelos relevantes. Os laboratórios acadêmicos desenvolveram muitos dos métodos, benchmarks e teorias subjacentes.

Então a afirmação correta não é “o Google Brain inventou a IA moderna”. A afirmação correta é: “o Google Brain foi um dos berços mais densos da IA moderna, porque combinou as intuições sobre pré-treinamento, a pesquisa da era do transformador, a infraestrutura e uma rede de talento que depois semeou os laboratórios de fronteira”. Isso é ao mesmo tempo mais exato e mais crível.

Já estamos na AGI?

A resposta de Dai é, em essência, não. O argumento dele não é que os modelos de linguagem sejam pouco impressionantes — muito pelo contrário. Em texto, código e algumas tarefas abstratas, os sistemas de IA atuais já são extremamente poderosos. Mas boa parte da economia real não é texto.

As empresas trabalham com plantas, diagramas elétricos, sistemas de fiação, modelos CAD, motores, canteiros de obras, imagens médicas, fazendas, robôs, infraestrutura e data centers. São problemas visuais, espaciais e físicos. Um modelo que escreve bom código mas não entende de forma confiável quais duas coisas um fio conecta ainda não é geral no sentido de que a indústria precisa.

Esse é o problema da “visão de bebê”. Os sistemas multimodais atuais sabem descrever imagens, mas ainda têm dificuldade com raciocínio visual preciso: contar, relações espaciais, permanência do objeto, diagramas, oclusão, rotação, restrições físicas e intenção de projeto. Os benchmarks recentes tornam a lacuna concreta — trabalhos como o BabyVision e o VisuLogic mostram que os principais modelos multimodais pontuam muito abaixo da referência humana em tarefas visuais básicas. Isso importa porque a próxima onda de IA pode depender menos de produzir texto melhor e mais de entender o mundo por trás do texto.

Para onde estamos indo? A próxima fase da IA

A primeira fase da IA moderna foi centrada na linguagem. Fazia sentido. A linguagem é abundante, digitalizada, compressível e profundamente ligada ao conhecimento humano. A web deu aos pesquisadores um conjunto de treino enorme. Os transformadores deram a eles uma arquitetura escalável. A modelagem de linguagem deu a eles um objetivo simples.

A próxima fase pode ser física e visual. Isso quer dizer sistemas de IA que não apenas legendam imagens, mas raciocinam diretamente através da informação visual — sistemas capazes de entender diagramas, layouts espaciais, restrições físicas, conjuntos mecânicos, desenhos de engenharia, tarefas de robótica e causa e efeito no mundo real. É para lá que apontam empresas como a Elorian: raciocínio visual nativo. A virada pode ser resumida assim:

  • Primeira onda: modelos que leem e escrevem
  • Segunda onda: modelos que veem e descrevem
  • Próxima onda: modelos que veem, raciocinam, projetam e agem

Isso se conecta a uma tendência mais ampla em torno dos modelos visão-linguagem-ação em robótica: sistemas que tomam observações visuais e instruções em linguagem e geram ações no mundo físico. Isso não quer dizer que amanhã haverá robôs em todo lugar. Quer dizer que a fronteira da pesquisa está se movendo de “IA como máquina de texto” para “IA como modelo de mundo”.

Por que o raciocínio visual pode importar mais que outro chatbot

Mais um chatbot pode ser útil. Mas o raciocínio visual e físico poderia abrir domínios muito maiores. Se os modelos conseguirem raciocinar visualmente, ficam mais úteis em arquitetura, engenharia, manufatura, robótica, construção, aeroespacial, agricultura, medicina, projeto de data centers e descoberta científica.

Esses não são casos de uso “bons de ter”. São onde vive boa parte da economia física. Um modelo capaz de ler um diagrama de fiação, entender uma peça de máquina, identificar um gargalo físico, raciocinar sobre uma planta ou ajudar a projetar infraestrutura está operando em outra categoria, diferente da de um chatbot. Por isso o “próximo nascimento” da IA pode não se parecer com um modelo de texto maior. Pode se parecer com um modelo que finalmente entenda estrutura visual e restrição física.

O enquadramento melhor: a IA não para de nascer

A expressão “o nascimento da IA” pode confundir se sugerir um único momento. Houve um nascimento original da IA como campo acadêmico no século XX. Houve um nascimento do aprendizado profundo como paradigma dominante. Houve um nascimento dos LLMs modernos através do pré-treinamento, dos transformadores, dos dados da web e da escala. Agora pode haver outro nascimento: o da IA visual e do mundo físico.

Esse enquadramento evita uma falsa história de origem única. Permite dizer algo mais exato: a IA teve vários nascimentos. O que estamos vivendo começou com a linguagem. O próximo pode começar com a visão. Essa é uma tese melhor do que simplesmente dizer “o Google Brain criou a IA”.

Perguntas frequentes

O Google Brain inventou a IA moderna?

Não. O Google Brain foi um dos berços mais densos da IA moderna, mas não o único. DeepMind, OpenAI, FAIR, laboratórios acadêmicos e muitos outros também deram contribuições importantes.

Por que Andrew Dai é importante nesta história?

Andrew Dai assinou com Quoc V. Le o artigo de 2015 sobre aprendizado sequencial semissupervisionado, passou anos no Google Brain e na DeepMind e depois cofundou a Elorian, uma empresa focada em raciocínio visual.

Qual foi o avanço de pré-treinamento de 2015?

Dai e Le mostraram que treinar modelos de sequência com dados não rotulados e depois ajustá-los em tarefas supervisionadas podia melhorar o desempenho. Isso antecipou o padrão de pré-treinar e depois adaptar que mais tarde ficou central nos LLMs modernos.

Por que os transformadores importaram?

Os transformadores tornaram a modelagem de sequências em larga escala mais paralelizável e escalável que as abordagens recorrentes anteriores. Combinados com objetivos de modelagem de linguagem, dados em escala da web e computação, viraram a arquitetura central dos LLMs modernos.

O que é a diáspora do Google Brain?

Refere-se à rede de pesquisadores que passaram pelo Google Brain, pela DeepMind ou pelo ecossistema de pesquisa do Google em sentido amplo e depois ajudaram a construir ou liderar laboratórios de fronteira e startups como OpenAI, Anthropic, Safe Superintelligence, Sakana AI, Periodic Labs e Elorian.

O que é a “visão de bebê”?

A “visão de bebê” é a ideia de que mesmo modelos multimodais poderosos ainda têm dificuldade com tarefas básicas de raciocínio visual e espacial que crianças pequenas resolvem. É uma forma útil de nomear a distância entre inteligência linguística e compreensão do mundo físico.

O raciocínio visual é a próxima fase da IA?

Pode ser uma das próximas grandes fronteiras. Modelos de texto e código já são fortes, mas muitos setores do mundo real dependem de raciocínio visual, espacial e físico. Modelos capazes de entender diagramas, projetos, objetos e restrições poderiam abrir novos domínios para a IA.

A história humana por trás da máquina

O público costuma ver o produto: ChatGPT, Gemini, Claude, Midjourney, Copilot, agentes. A história mais profunda é mais difícil de ver. São artigos, conversas na copa do escritório, experimentos fracassados, infraestrutura de computação, contratações pouco convencionais, segurança psicológica e um grupo de pesquisadores aprendendo uns com os outros por osmose.

Andrew Dai e Quoc Le viram que a modelagem de linguagem podia virar uma base para a compreensão. Ilya Sutskever, Oriol Vinyals e Quoc Le ajudaram a estabelecer o aprendizado sequência a sequência. Os autores do transformador deram à área a arquitetura de que ela precisava para escalar. Geoffrey Hinton forneceu uma filosofia de representação aprendida inspirada no cérebro. Jeff Dean ajudou a criar a infraestrutura e a cultura de sistemas que permitiram escalar a pesquisa. Gente como Dario Amodei, Sara Hooker, David Ha, Liam Fedus, Ilya Sutskever e Andrew Dai levou pedaços dessa cultura para a geração seguinte de laboratórios de IA.

Até Isaac Asimov pertence à borda da história, pela recomendação que Dai faz da série Fundação. Asimov escreveu sobre arcos longos da história, causas ocultas e pequenos grupos de pessoas moldando futuros enormes. A história da IA tem algo dessa forma. A IA moderna não nasceu de uma invenção. Nasceu da convergência de pessoas, ideias, arquitetura, dados, computação e cultura.

E se a próxima fase é a inteligência visual e do mundo físico, a pergunta não é só qual modelo vence. A pergunta de fundo é: onde está o próximo Google Brain? Onde está o próximo lugar que combine densidade de talento, infraestrutura, liberdade, segurança psicológica e paciência para problemas difíceis? É lá que a próxima IA pode nascer.

Fontes e leituras adicionais