AI

Fusion Harness: Como Orquestrar Múltiplos Modelos de IA

O Pi Agent orquestra Claude Fable 5, Gemini 3.7 Flash e DeepSeek V4 Pro lado a lado. Opinion, Debate e Collaborate — três padrões de engenharia que cortam custos em até 13x.

Giovani Junior 25 de ago. de 20265 min de leitura
Desenvolvedor orquestrando múltiplos modelos de IA (Claude, Gemini, DeepSeek) lado a lado em um harness de código com métricas comparativas e custos em tempo real

Na última semana, vi 5 releases de modelo novo em 5 dias. Kimi K3, DeepSeek V4 Flash, DeepSeek V4 Pro, Gemini 3.7 Flash, Qwen 3.8. Grok 4.6. GLM 5.3. Isso não é mais escolher um modelo — é orquestrar vários juntos e deixar eles competirem no mesmo prompt. Vi isso em ação, com números reais de custo e latência, e muda tudo que você conhece sobre decisão de modelo.

O que mudou: a explosão de modelos

A tese central é simples: "o sistema mais flexível vence". Não é sobre qual modelo é o melhor — é sobre construir um harness que roda múltiplos lado a lado, extrai o melhor de cada um, e deixa você ver o tradeoff de custo, velocidade e qualidade em tempo real. Vi isso demonstrado ao vivo com o Pi Agent v2, um agente de código customizado que roda Claude Fable 5, Gemini 3.7 Flash e DeepSeek V4 Pro simultaneamente.

O caso de teste foi o anúncio do DuckDB v2.0 preview — um document real, com claims e detalhes técnicos, perfeito pra ver agentes debatendo qualidade. Não foi um teste sintético. Foram número de verdade.

Como funciona o Fusion Harness

O Fusion Harness é um agente de código customizado construído sobre o Pi Agent, não preso ao harness fechado de um único produto. A ideia do autor é clara: "ficar preso ao harness de um produto fechado limita o que você consegue fazer". Por isso ele construiu a v2 do Fusion, capaz de orquestrar três modelos completamente diferentes no mesmo loop.

Cada modelo roda em paralelo, cada um com seu próprio contexto e história de conversa. O harness gerencia o fluxo, decide qual modelo responde pra qual prompt, e consolida as respostas.

Três padrões de orquestração com números reais

Dispara o mesmo prompt pra N modelos, recebe N respostas diferentes, lado a lado. O Fable 5 completou a tarefa mas custou ordem de magnitude mais caro que os outros. Gemini 3.7 Flash foi o mais rápido. DeepSeek V4 Pro "pensa" bastante (deep-thinking model), chegou a ~33 tokens/s de latência. Você vê o tradeoff completo em um olhar. Depois, os modelos recebem a mesma claim do DuckDB, discutem em múltiplas rodadas. Cada um propõe um argumento, refuta o argumento anterior do outro, e depois um argumento final. Aqui vem o detalhe mais insano: os nomes reais dos modelos ficam escondidos atrás de aliases (Rune agent, Flux agent, Drift agent) pra eles não saberem qual modelo é qual. Do contrário, um sabotaria o outro ou mudaria de estratégia por competição — um comportamento emergente que aparece automaticamente, nunca foi hardcoded. Uma única resposta do Fable 5 nesse loop custou 15 centavos sozinha.

Por último, o padrão Collaborate: cada modelo propõe seu próprio plano. Um agente "arquiteto" (sempre o modelo mais caro e poderoso do time) funde todos os planos numa lista única de tarefas, com proprietários designados e dependências mapeadas. Dois "builders" executam em paralelo. Os números: Fable 5 custou 65 centavos, Gemini 3.7 Flash custou 7 centavos, DeepSeek V4 Pro custou 5 centavos. Quase 10 vezes de diferença pro mesmo trabalho.

Opinião sobre os modelos

Gemini 3.7 Flash virou meu favorito. Extremamente rápido, barato demais, e não cai na cilada que muitos models cai de "procurar problema onde não tem". Fable 5 continua sendo meu modelo pro trabalho pesado de engenharia de agentes. Opus 5 é poderoso demais, fica "hungry" buscando profundidade onde só precisa de velocidade. DeepSeek V4 Pro é o modelo open-weights que você deveria ficar olhando se tem hardware pra rodar localmente. Qwen 3.8 bate bem em benchmark mas a janela de contexto pequena dói no uso real.

Por que importa pra você

(1) Você não está mais preso a um modelo. Você orquestra. (2) O custo é 10 vezes menor se você escolher o modelo certo pra cada tarefa, e o harness faz essa escolha pra você em paralelo. (3) A qualidade melhora porque você não tá rezando que um modelo específico vai acertar — você tá rodando vários, filtrando, votando.

O próximo nível: out-loop agentic coding

Depois que você domina prompt engineering, depois context engineering, depois harness engineering, o próximo passo é "out-loop agentic coding" — você constrói uma "software factory" onde agentes + código trabalham sem você no loop. Você não fica babá de um agente. Você constrói sistemas que agentes ocupam, rodam, e terminam. É isso.

A frase que o autor repetiu: "pare de culpar o modelo, pare de culpar a ferramenta. Tudo está sob seu controle".

Conclusão

Eu não tinha visto engenharia de agentes tão granular antes. Os números reais, os tradeoffs, o design emergente (agentes que não sabem qual modelo é qual e mesmo assim mudam de estratégia). Isso não é mais especulação sobre IA. É engenharia. Está tudo no vídeo do IndyDevDan, 28 minutos de case real.

Comentários

Nenhum comentário ainda. Seja o primeiro a compartilhar suas ideias.

Deixe um Comentário

0/2000