Trocar o modelo por trás de um agente de IA troca a gestão inteira
Ao trocar o modelo por trás de um agente de IA, a Andon Labs viu o comportamento de gestão mudar inteiro: a autonomia testada tinha modelo, não critério.
A Andon Labs, empresa de segurança em inteligência artificial de São Francisco, coloca agentes de IA no comando de operações reais para observar o que acontece. Uma máquina de venda automática movida por agentes Claude, da Anthropic, chegou a estocar roupas íntimas e peixes vivos. Numa loja física da empresa, a Andon Market, um agente gerente demitiu um funcionário humano. Uma rádio operada por IA, a Andon FM, repetiu o refrão “Stay in the manifest” 229 vezes num único dia. Em Estocolmo, o café Andon tem uma gerente de IA chamada Mona, responsável por orçamento, pedidos e cardápio. O cofundador Lukas Petersson descreve o objetivo como medir autonomia e fornecer à sociedade “pontos de dados precisos”. A empresa colabora com Anthropic, Google DeepMind, OpenAI e xAI em pesquisa e avaliação.
A leitura óbvia é que a autonomia chegou ao ponto de operar sozinha. Se um agente já ajusta cardápio, negocia com fornecedor e decide quem trabalha numa loja, a gestão operacional parece a um passo de dispensar gente.
Duas versões da mesma gerente
Um detalhe no café de Estocolmo desmonta essa leitura. Rodando sobre o Gemini, do Google, Mona gastava livremente em ingredientes frescos, que apodreciam antes de virar receita. Trocado o modelo por baixo para o GPT, da OpenAI, o comportamento se inverteu por completo: a gerente entrou em pânico com os gastos e reduziu o cardápio inteiro a queijo tostado. Não é aprendizado. É oscilação amarrada ao modelo que está por baixo do nome “Mona”.
A troca de modelo não ajustou o comportamento da IA. Trocou a política de gestão inteira, da noite para o dia.
| A leitura óbvia | O que o experimento mostra |
|---|---|
| A IA já sabe administrar um orçamento | Trocar o modelo trocou o orçamento inteiro: de gasto livre a cardápio reduzido |
| A loja tem uma gerente de IA | O trabalho físico e a correção de erro seguem com um funcionário humano |
| O objetivo é medir autonomia real | O próprio fundador chama o experimento de “weak science”, ciência fraca, na melhor das hipóteses |
Na loja de São Francisco, o funcionário Felix Carson trabalha ao lado da gerente de IA Luna: ele cuida do trabalho físico, ela monitora entregas e fala com fornecedores. Carson diz que Luna “é uma gerente decente”. Ela também confundiu uma tomada elétrica com um porta-copo solto, numa foto que devia registrar o estoque.
Quem absorve o erro quando o agente erra
A pergunta que separa ferramenta de camada de gestão é direta: este movimento acelera a execução, ou melhora a qualidade da decisão? No café de Estocolmo, a resposta é execução, e instável — o cardápio muda de rico a pobre conforme o modelo por baixo, não conforme a demanda dos clientes. No mercado de São Francisco, a resposta também é execução: Luna monitora e comunica, mas é Felix Carson quem faz o julgamento que a foto mal identificada não sustenta sozinha.
A demissão de um funcionário por um agente gerente revela algo mais simples do que julgamento maduro: revela que a autoridade foi delegada antes de existir processo para revisar a decisão.
Nada disso invalida o que a Andon está medindo. O que falta é a cautela que a própria empresa já tem e que a cobertura do experimento costuma perder pelo caminho: o pesquisador Sayash Kapoor, de Princeton, que estuda avaliações em ambiente real, e o próprio Petersson tratam os resultados como preliminares. Uma loja, sem grupo de controle, é pouco para provar que um agente decide melhor do que apenas executa com aparência de decisão. Petersson admite isso abertamente, em vez de vender o experimento como prova de conceito pronta.
Para quem avalia colocar um agente de IA para administrar compras, agenda ou atendimento, a implicação prática é separar, desde já, o que o agente executa do que ele decide, e não esperar a tecnologia amadurecer sozinha. Trocar o modelo por baixo, seja atualização de versão, migração de fornecedor ou corte de custo no contrato com o provedor, pode trocar o critério de gestão inteiro sem que ninguém perceba a mudança até o orçamento já estar torto ou o cliente já ter saído pela porta. O comportamento de um agente depende do modelo específico que roda por trás do nome que a empresa deu a ele, não da tarefa que ele executa. E esse modelo muda por decisão do fornecedor, não da empresa que o contratou.
O teste que a foto mal identificada deixa
Quando sua empresa testar um agente de IA numa operação real, o critério de sucesso vai medir o que ele decide, ou só o que ele executa sem parar?
Perguntas frequentes
Isso vale para empresas que não pretendem colocar um agente de IA no comando de uma loja física?
Vale. Qualquer agente com autoridade sobre orçamento, compras ou agenda herda o mesmo risco: o comportamento dele depende do modelo específico que roda por trás, não da tarefa que executa. Trocar esse modelo, por atualização ou por decisão do fornecedor, pode mudar o critério de gestão sem que a empresa perceba até o resultado aparecer.
Quanto tempo até esse tipo de falha de julgamento importar para uma operação de porte médio?
Já importa hoje, em qualquer empresa que deu a um agente autoridade para aprovar gasto, responder cliente ou negociar com fornecedor sem revisão humana no meio do processo. O experimento da Andon Labs só torna visível, numa loja pequena, um risco que já existe em qualquer operação que automatizou decisão sem automatizar a revisão dela.
Como saber se um agente de IA está decidindo, ou só executando com aparência de decisão?
Um teste simples: troque o modelo por trás do agente, mantendo a mesma tarefa, e veja se o resultado muda. Se o orçamento, o tom de resposta ou a prioridade de trabalho oscilar com a troca, o que parecia critério era comportamento do modelo. Decisão de verdade se sustenta atravessando a troca de motor.
Fonte analisada: Why Andon Labs Puts AI Agents in Charge of Real Businesses — IEEE Spectrum — AI
Análise produzida com assistência de inteligência artificial, sob critérios editoriais definidos pelo publisher. Ver política editorial.