En vous promenant sur AEGIS IA LOCALE, nous stockons votre IP 48h pour des raisons de sécurité.

Desenvolvimento sustentável & IA local

Nada de greenwashing, mas números para lhe mostrar em que somos bons!

O problema

A IA consome. Muito. Não é grave, exceto quando chega a fatura.

Não lhe vamos fazer o número do «salve o planeta com a nossa IA verde» quando estamos apenas a correr os mesmos modelos que toda a gente. Em contrapartida, podemos explicar-lhe porque é que uma infraestrutura local AEGIS IA consome significativamente menos do que uma assinatura cloud a longo prazo.

Preparado para um pouco de física e matemática?

O que um LLM cloud consome realmente

Um estudo académico recente (Jegham et al., 2025) mediu o consumo real dos grandes LLM comerciais e os números assustam:

📊 Consumo por pedido (modelos cloud)

  • GPT-4o : 0,43 Wh por pedido curto
  • o3 (OpenAI) : 39,2 Wh por prompt longo (70x mais do que um modelo nano)
  • DeepSeek-R1 : 33,6 Wh por prompt longo

Fonte: Jegham et al. (2025), «How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference», arXiv:2505.09598

Para contextualizar: um único pedido longo ao o3 consome tanta eletricidade como uma TV LED de 65 polegadas ligada durante 20-30 minutos.

Agora, multipliquemos isso por 700 milhões de pedidos por dia (estimativa conservadora para o GPT-4o em 2025):

  • Consumo elétrico anual : 391 509 a 463 269 MWh — o equivalente a 35 000 lares americanos ou a quase 77 000 lares europeus (comparando os dados da Enedis e da EIA dos EUA)
  • Água evaporada (arrefecimento dos datacenters): 1,33 a 1,58 milhões de quilolitros — o suficiente para encher 500 piscinas olímpicas
  • Emissões de carbono : 138 125 a 163 441 toneladas de CO₂ — o equivalente a 30 000 carros a gasolina

E estamos a falar deum único modelo. Junte-lhe o Gemini, o Mistral, todos os outros...

O paradoxo de Jevons aplicado à IA

Conhece o paradoxo de Jevons? Quanto mais eficiente se torna uma coisa, mais as pessoas a usam (pense na autoestrada do Luxemburgo 😂), pelo que, no fim, se consome mais apesar da otimização.

É exatamente o que acontece com os LLM cloud:

  • O GPT-4o é mais eficiente por pedido do que o GPT-3
  • Por isso, as pessoas usam-no 10x mais
  • Resultado: o consumo global explode

Uma pesquisa no Google consome 0,30 Wh. Um pedido ao GPT-4o consome 0,43 Wh. São mais 40%. Não é muito? Agora multiplique por milhares de milhões de pedidos diários.

A infraestrutura escondida dos datacenters

O que não lhe dizem: os números acima estão claramente SUBESTIMADOS.

Porquê? Porque os datacenters não consomem apenas para pôr as GPU a funcionar. Consomem também para:

  • Arrefecimento : 40-54% do consumo total de um datacenter
  • Redes e infraestrutura : routers, switches, cablagem ativa
  • Redundância : alimentações de emergência, sistemas de backup
  • Overhead operacional : iluminação, segurança, monitorização
  • E, em menor medida, as despesas ligadas aos funcionários : refeições, computadores pessoais, transporte

O PUE (Power Usage Effectiveness) médio de um datacenter é de 1,5 a 2,0. Isto significa que, por cada 1 Watt consumido por uma GPU, é preciso mais 0,5 a 1 Watt só para a pôr a funcionar.

Fonte: Patterson et al. (2021), «Carbon Emissions and Large Neural Network Training»

Então, quanto custa tudo isto? (o cerne da questão)

Não vamos mentir: a fatura é o que motiva

💰 Comparação de custos API cloud vs local (em 3 anos)

Cenário: 50 colaboradores, utilização moderada (500 pedidos/dia/pessoa)

Rubrica API cloud Infraestrutura local
Ano 1 ~60 000 € (tokens) ~80 000 € (hardware + instalação)
Ano 2 ~60 000 € ~15 000 € (eletricidade + manutenção)
Ano 3 ~60 000 € ~15 000 €
TOTAL 3 ANOS 180 000 € 110 000 €

Break-even: 18-24 meses

Fonte: Calculado a partir de Lenovo Press (2025), «On-Premise vs Cloud: Generative AI Total Cost of Ownership»

E atenção: estes números pressupõem que os preços das suas APIs se mantêm estáveis. Já adivinhamos: não se mantêm.

A OpenCoisa pode decidir amanhã duplicar os preços. Não pode fazer nada. Fica refém.

Com uma infraestrutura local, o seu custo marginal por pedido diminui com o tempo. Quanto mais a usa, menos custa por pedido. E isso é exatamente o contrário da cloud.

A pegada de carbono: falemos a sério

Um datacenter americano médio usa um mix elétrico com ~60% de fósseis (carvão, gás). Um datacenter europeu anda mais pelos 30-40%, consoante o país.

O seu servidor local aí na Lorena? Liga-se ao mix elétrico francês: ~70% nuclear + 20% renováveis. Emissões de CO₂: 50-60 g/kWh.

Um datacenter da AWS na Virgínia (região us-east-1, a mais comum)? Mix elétrico: 40% gás, 35% carvão. Emissões: 350-400 g/kWh.

Mesmo cálculo, 6-7x menos CO₂ em França do que na Virgínia.

Isto não é greenwashing. Estamos apenas a constatar que ligar um servidor à rede da EDF emite menos do que um datacenter da AWS na Virgínia.

Os custos escondidos da cloud

O que muitas vezes se esquece de contar no TCO cloud:

  • Aumentos de preço : a OpenAI, a Anthropic e a Google podem mudar as tarifas quando quiserem. Fica dependente.
  • Tokens de output 2-4x mais caros do que os tokens de input. Se o seu LLM gera muito texto, surpresa.
  • Penalizações de rate limiting : ultrapasse a sua quota e pague 2-3x mais por token.
  • Custos de egress : tirar dados da cloud custa os olhos da cara (a AWS adora isso).
  • Suporte enterprise : +15-30% na fatura se quiser um SLA decente.

Resultado: a sua fatura mensal de 5000 € pode rapidamente passar a 8000 € sem ter mudado nada.

Fonte: MPT Solutions (2025), «The Hidden Infrastructure Cost of Running Local LLMs vs Cloud APIs»

A infraestrutura local também não é grátis

Sejamos honestos. Uma infraestrutura local também custa. Eis o que é preciso contar realmente:

  • Hardware : 40 000 € a 80 000 € para uma configuração decente (2-4 GPU profissionais do tipo L40S ou A100)
  • Eletricidade : ~5000-10 000 €/ano consoante a utilização
  • Arrefecimento : se a sua sala de servidores for mal ventilada, preveja ar condicionado. 2000-5000 €/ano.
  • Manutenção : renovação do hardware a cada 3-5 anos
  • Pessoal : ou já tem engenheiros de TI, ou é preciso formar/recrutar

Mas, uma vez amortizada (18-24 meses), o seu custo marginal por pedido é irrisório comparado com a cloud.

E sobretudo: o controlo é seu. Sem surpresas, sem dependência nem aumentos inesperados (e muitas vezes brutais).

Porque vai haver. O retorno do investimento dos grandes LLM como o ChatGPT é de 3,5 US$ de retorno por cada 5 US$ investidos!

O modelo híbrido (a ideia realmente boa)

Não lhe vamos mentir: o 100% local nem sempre é o ideal. Também temos os nossos desafios.

O híbrido, uma agilidade real:

  • Tarefas simples e recorrentes (FAQ, classificação, extração) → Modelo local 7B-13B. Custo marginal quase nulo.
  • Tarefas complexas e ocasionais (raciocínio em várias etapas, criatividade) → API cloud se necessário. Só paga o excecional.
  • Dados sensíveis → Local, sempre. Não é negociável.
  • Picos de carga → Burst para a cloud se a sua infraestrutura local saturar. Mas é a exceção, não a regra.

Resultado: combina o melhor dos dois mundos. Custos controlados, desempenho ótimo, soberania preservada.

A AEGIS IA não se faz passar pelo homenzinho verde

Não pretendemos salvar o planeta.

O que fazemos:

  • Implementamos infraestruturas locais dimensionadas para as suas necessidades (sem sobre-equipamento inútil)
  • Otimizamos os modelos para reduzir o consumo por pedido (quantização, destilação quando pertinente)
  • Ajudamo-lo a calcular o seu TCO real (cloud vs local) com números honestos
  • Usamos o mix elétrico local (em França = baixo carbono)
  • Evitamos o desperdício: nada de GPU a rodar em vazio 90% do tempo

É isso. Nada de certificados de compensação de carbono. Apenas uma infraestrutura eficiente que consome o que tem de consumir, e não mais.

Fontes académicas e referências

As nossas fontes:

  • Jegham et al. (2025) : «How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference», arXiv:2505.09598 — Estudo comparativo de 30 LLM comerciais
  • Patterson et al. (2021) : «Carbon Emissions and Large Neural Network Training», arXiv:2104.10350 — Análise da pegada de carbono do treino de LLM
  • Lenovo Press (2025) : «On-Premise vs Cloud: Generative AI Total Cost of Ownership» — Análise de TCO detalhada com pontos de break-even
  • Scientific Reports (2024) : «Reconciling the contrasting narratives on the environmental impact of large language models», Nature — Comparação LLM vs trabalho humano
  • Strubell et al. (2019) : «Energy and Policy Considerations for Deep Learning in NLP», ACL — Primeiro grande estudo sobre o consumo energético dos LLM
  • Venditti B. (2025) : Ranked: Electricity Use Per Capita in Major Global Economies

Conclusão: faça as contas você mesmo!

A IA local nem sempre é a solução. Mas, para 80% das empresas com uma utilização estável e previsível, é económica e ecologicamente mais viável do que a cloud ao fim de 2-3 anos.

Se gasta mais de 2000 €/mês em APIs cloud, já está mais do que na hora de olhar para a questão.

Podemos ajudá-lo. Sem conversa fiada, com números reais e um TCO transparente.

Escreva-nos!

de en es fr pt