Desenvolvimento sustentável & IA local
Nada de greenwashing, mas números para lhe mostrar em que somos bons!
O problema
A IA consome. Muito. Não é grave, exceto quando chega a fatura.
Não lhe vamos fazer o número do «salve o planeta com a nossa IA verde» quando estamos apenas a correr os mesmos modelos que toda a gente. Em contrapartida, podemos explicar-lhe porque é que uma infraestrutura local AEGIS IA consome significativamente menos do que uma assinatura cloud a longo prazo.
Preparado para um pouco de física e matemática?
O que um LLM cloud consome realmente
Um estudo académico recente (Jegham et al., 2025) mediu o consumo real dos grandes LLM comerciais e os números assustam:
📊 Consumo por pedido (modelos cloud)
- GPT-4o : 0,43 Wh por pedido curto
- o3 (OpenAI) : 39,2 Wh por prompt longo (70x mais do que um modelo nano)
- DeepSeek-R1 : 33,6 Wh por prompt longo
Fonte: Jegham et al. (2025), «How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference», arXiv:2505.09598
Para contextualizar: um único pedido longo ao o3 consome tanta eletricidade como uma TV LED de 65 polegadas ligada durante 20-30 minutos.
Agora, multipliquemos isso por 700 milhões de pedidos por dia (estimativa conservadora para o GPT-4o em 2025):
- Consumo elétrico anual : 391 509 a 463 269 MWh — o equivalente a 35 000 lares americanos ou a quase 77 000 lares europeus (comparando os dados da Enedis e da EIA dos EUA)
- Água evaporada (arrefecimento dos datacenters): 1,33 a 1,58 milhões de quilolitros — o suficiente para encher 500 piscinas olímpicas
- Emissões de carbono : 138 125 a 163 441 toneladas de CO₂ — o equivalente a 30 000 carros a gasolina
E estamos a falar deum único modelo. Junte-lhe o Gemini, o Mistral, todos os outros...
O paradoxo de Jevons aplicado à IA
Conhece o paradoxo de Jevons? Quanto mais eficiente se torna uma coisa, mais as pessoas a usam (pense na autoestrada do Luxemburgo 😂), pelo que, no fim, se consome mais apesar da otimização.
É exatamente o que acontece com os LLM cloud:
- O GPT-4o é mais eficiente por pedido do que o GPT-3
- Por isso, as pessoas usam-no 10x mais
- Resultado: o consumo global explode
Uma pesquisa no Google consome 0,30 Wh. Um pedido ao GPT-4o consome 0,43 Wh. São mais 40%. Não é muito? Agora multiplique por milhares de milhões de pedidos diários.
A infraestrutura escondida dos datacenters
O que não lhe dizem: os números acima estão claramente SUBESTIMADOS.
Porquê? Porque os datacenters não consomem apenas para pôr as GPU a funcionar. Consomem também para:
- Arrefecimento : 40-54% do consumo total de um datacenter
- Redes e infraestrutura : routers, switches, cablagem ativa
- Redundância : alimentações de emergência, sistemas de backup
- Overhead operacional : iluminação, segurança, monitorização
- E, em menor medida, as despesas ligadas aos funcionários : refeições, computadores pessoais, transporte
O PUE (Power Usage Effectiveness) médio de um datacenter é de 1,5 a 2,0. Isto significa que, por cada 1 Watt consumido por uma GPU, é preciso mais 0,5 a 1 Watt só para a pôr a funcionar.
Fonte: Patterson et al. (2021), «Carbon Emissions and Large Neural Network Training»
Então, quanto custa tudo isto? (o cerne da questão)
Não vamos mentir: a fatura é o que motiva
💰 Comparação de custos API cloud vs local (em 3 anos)
Cenário: 50 colaboradores, utilização moderada (500 pedidos/dia/pessoa)
| Rubrica | API cloud | Infraestrutura local |
|---|---|---|
| Ano 1 | ~60 000 € (tokens) | ~80 000 € (hardware + instalação) |
| Ano 2 | ~60 000 € | ~15 000 € (eletricidade + manutenção) |
| Ano 3 | ~60 000 € | ~15 000 € |
| TOTAL 3 ANOS | 180 000 € | 110 000 € |
Break-even: 18-24 meses
Fonte: Calculado a partir de Lenovo Press (2025), «On-Premise vs Cloud: Generative AI Total Cost of Ownership»
E atenção: estes números pressupõem que os preços das suas APIs se mantêm estáveis. Já adivinhamos: não se mantêm.
A OpenCoisa pode decidir amanhã duplicar os preços. Não pode fazer nada. Fica refém.
Com uma infraestrutura local, o seu custo marginal por pedido diminui com o tempo. Quanto mais a usa, menos custa por pedido. E isso é exatamente o contrário da cloud.
A pegada de carbono: falemos a sério
Um datacenter americano médio usa um mix elétrico com ~60% de fósseis (carvão, gás). Um datacenter europeu anda mais pelos 30-40%, consoante o país.
O seu servidor local aí na Lorena? Liga-se ao mix elétrico francês: ~70% nuclear + 20% renováveis. Emissões de CO₂: 50-60 g/kWh.
Um datacenter da AWS na Virgínia (região us-east-1, a mais comum)? Mix elétrico: 40% gás, 35% carvão. Emissões: 350-400 g/kWh.
Mesmo cálculo, 6-7x menos CO₂ em França do que na Virgínia.
Isto não é greenwashing. Estamos apenas a constatar que ligar um servidor à rede da EDF emite menos do que um datacenter da AWS na Virgínia.
Os custos escondidos da cloud
O que muitas vezes se esquece de contar no TCO cloud:
- Aumentos de preço : a OpenAI, a Anthropic e a Google podem mudar as tarifas quando quiserem. Fica dependente.
- Tokens de output 2-4x mais caros do que os tokens de input. Se o seu LLM gera muito texto, surpresa.
- Penalizações de rate limiting : ultrapasse a sua quota e pague 2-3x mais por token.
- Custos de egress : tirar dados da cloud custa os olhos da cara (a AWS adora isso).
- Suporte enterprise : +15-30% na fatura se quiser um SLA decente.
Resultado: a sua fatura mensal de 5000 € pode rapidamente passar a 8000 € sem ter mudado nada.
Fonte: MPT Solutions (2025), «The Hidden Infrastructure Cost of Running Local LLMs vs Cloud APIs»
A infraestrutura local também não é grátis
Sejamos honestos. Uma infraestrutura local também custa. Eis o que é preciso contar realmente:
- Hardware : 40 000 € a 80 000 € para uma configuração decente (2-4 GPU profissionais do tipo L40S ou A100)
- Eletricidade : ~5000-10 000 €/ano consoante a utilização
- Arrefecimento : se a sua sala de servidores for mal ventilada, preveja ar condicionado. 2000-5000 €/ano.
- Manutenção : renovação do hardware a cada 3-5 anos
- Pessoal : ou já tem engenheiros de TI, ou é preciso formar/recrutar
Mas, uma vez amortizada (18-24 meses), o seu custo marginal por pedido é irrisório comparado com a cloud.
E sobretudo: o controlo é seu. Sem surpresas, sem dependência nem aumentos inesperados (e muitas vezes brutais).
Porque vai haver. O retorno do investimento dos grandes LLM como o ChatGPT é de 3,5 US$ de retorno por cada 5 US$ investidos!
O modelo híbrido (a ideia realmente boa)
Não lhe vamos mentir: o 100% local nem sempre é o ideal. Também temos os nossos desafios.
O híbrido, uma agilidade real:
- Tarefas simples e recorrentes (FAQ, classificação, extração) → Modelo local 7B-13B. Custo marginal quase nulo.
- Tarefas complexas e ocasionais (raciocínio em várias etapas, criatividade) → API cloud se necessário. Só paga o excecional.
- Dados sensíveis → Local, sempre. Não é negociável.
- Picos de carga → Burst para a cloud se a sua infraestrutura local saturar. Mas é a exceção, não a regra.
Resultado: combina o melhor dos dois mundos. Custos controlados, desempenho ótimo, soberania preservada.
A AEGIS IA não se faz passar pelo homenzinho verde
Não pretendemos salvar o planeta.
O que fazemos:
- Implementamos infraestruturas locais dimensionadas para as suas necessidades (sem sobre-equipamento inútil)
- Otimizamos os modelos para reduzir o consumo por pedido (quantização, destilação quando pertinente)
- Ajudamo-lo a calcular o seu TCO real (cloud vs local) com números honestos
- Usamos o mix elétrico local (em França = baixo carbono)
- Evitamos o desperdício: nada de GPU a rodar em vazio 90% do tempo
É isso. Nada de certificados de compensação de carbono. Apenas uma infraestrutura eficiente que consome o que tem de consumir, e não mais.
Fontes académicas e referências
As nossas fontes:
- Jegham et al. (2025) : «How Hungry is AI? Benchmarking Energy, Water, and Carbon Footprint of LLM Inference», arXiv:2505.09598 — Estudo comparativo de 30 LLM comerciais
- Patterson et al. (2021) : «Carbon Emissions and Large Neural Network Training», arXiv:2104.10350 — Análise da pegada de carbono do treino de LLM
- Lenovo Press (2025) : «On-Premise vs Cloud: Generative AI Total Cost of Ownership» — Análise de TCO detalhada com pontos de break-even
- Scientific Reports (2024) : «Reconciling the contrasting narratives on the environmental impact of large language models», Nature — Comparação LLM vs trabalho humano
- Strubell et al. (2019) : «Energy and Policy Considerations for Deep Learning in NLP», ACL — Primeiro grande estudo sobre o consumo energético dos LLM
- Venditti B. (2025) : Ranked: Electricity Use Per Capita in Major Global Economies
Conclusão: faça as contas você mesmo!
A IA local nem sempre é a solução. Mas, para 80% das empresas com uma utilização estável e previsível, é económica e ecologicamente mais viável do que a cloud ao fim de 2-3 anos.
Se gasta mais de 2000 €/mês em APIs cloud, já está mais do que na hora de olhar para a questão.
Podemos ajudá-lo. Sem conversa fiada, com números reais e um TCO transparente.
