Novo modelo de IA da Meta já roda em hardware AMD sem depender da nuvem
O Meta Superintelligence Labs liberou o Muse Glimmer , um modelo de linguagem denso de 30 bilhões de parâmetros com pesos abertos sob licença Apache 2.0, projetado especificamente…

O Meta Superintelligence Labs liberou o Muse Glimmer, um modelo de linguagem denso de 30 bilhões de parâmetros com pesos abertos sob licença Apache 2.0, projetado especificamente para execução local de cargas de trabalho agentes.
Em testes preliminares realizados no Windows com o projeto llama.cpp utilizando backend Vulkan e decodificação especulativa dFlash, o modelo atingiu até 24 tokens por segundo em um processador AMD Ryzen AI Max+ 395 e até 53 tokens por segundo em uma única placa de vídeo AMD Radeon AI PRO R9700.
O anúncio posiciona o hardware AMD como caminho para viabilizar sistemas de inteligência artificial com memória persistente, uso de ferramentas e privacidade de dados diretamente na máquina do usuário, eliminando latência e custos recorrentes com tokens associados a abordagens focadas em nuvem.
Arquitetura do modelo e foco em fluxos agentes complexos
A IA em questão, conhecida como agente, precisa de contexto amplo, capacidade de navegar por múltiplas decisões, chamar ferramentas, inspecionar resultados e se adaptar continuamente.
O Muse Glimmer 30B foi treinado para sustentar períodos de trabalho mais longos, incluindo fluxos que atravessam várias etapas e sessões distintas. O modelo gerencia memória entre interações, se recupera de falhas e mantém continuidade mesmo após reinicializações.
Essas características permitem que desenvolvedores construam agentes capazes de assumir tarefas significativas em vez de se limitarem a interações pontuais.
Sistemas agentes acessam arquivos, mensagens, credenciais e conteúdos de fontes externas presentes na máquina do usuário, tornando a execução local um fator determinante para a experiência (caso contrário, a privacidade pode se tornar um problema real).

Privacidade e segurança como fundamentos do design
O treinamento do Muse Glimmer 30B priorizou a resistência a injeções de prompt originadas de conteúdo não confiável.
O modelo também foi condicionado a minimizar o compartilhamento excessivo de informações e a respeitar limites de informação previamente estabelecidos.
A execução local concede ao desenvolvedor controle direto sobre onde os dados são processados e como o modelo se conecta ao restante do fluxo de trabalho, sem que informações sensíveis precisem trafegar por servidores externos.

Licenciamento Apache 2.0 e flexibilidade para desenvolvedores
A licença Apache 2.0 permite o uso comercial, a modificação, a redistribuição e a integração do Muse Glimmer 30B com ferramentas e scaffolds de código aberto já adotados pela comunidade.
Esses scaffolds funcionam como estruturas iniciais e automáticas de código que servem como “andaimes” para acelerar o desenvolvimento.
Não há restrições quanto à construção de produtos derivados ou à incorporação do modelo em aplicações proprietárias.
Execução simplificada com LM Studio

O LM Studio oferece um caminho direto para consumidores executarem o Muse Glimmer localmente. Em sistemas AMD compatíveis equipados com mais de 32 GB de VRAM ou Memória de Vídeo Variável (VGM), o processo de descoberta, download e inicialização do modelo se completa em poucos minutos.
O hardware recomendado inclui sistemas baseados no processador AMD Ryzen AI Max+ e placas de vídeo AMD Radeon AI PRO R9700 com 32 GB.
Para desempenho ideal, o dFlash precisa estar ativado com o número correto de tokens de rascunho configurados. Usuários avançados podem usar o modelo via rede local por meio do servidor LM Studio.
O endpoint compatível com OpenAI ou Anthropic permite conexão com agentes populares como Hermes Agent e Open Claw, ou qualquer aplicação compatível com esses protocolos.
Essa abordagem viabiliza testes contra fluxos de trabalho reais sem a necessidade de desenvolver uma aplicação própria como etapa prévia.
Integração em aplicações com o binário incorporável Lemonade

Enquanto o LM Studio foca na experiência direta do usuário final, o Lemonade resolve o problema de empacotar o Muse Glimmer 30B como funcionalidade dentro de uma aplicação.
A ferramenta consiste em um binário incorporável de aproximadamente 4 MB que o desenvolvedor empacota diretamente com seu software.
Ao ser iniciado como serviço local privado, o Lemonade expõe uma Application Programming Interface (API) compatível com OpenAI.
O desenvolvedor conecta apps e ferramentas existentes usando padrões já conhecidos, enquanto o modelo e seus dados de trabalho permanecem na máquina.
A camada de complexidade (detecção de hardware, seleção de backend e inferência otimizada em processadores AMD Ryzen AI e gráficos AMD Radeon) é gerenciada automaticamente.
O usuário final permanece dentro da aplicação principal, sem necessidade de instalar o Lemonade separadamente ou configurar pilhas de inferência.
O resultado transforma o Muse Glimmer 30B de um agente executado manualmente em uma funcionalidade integrada, abrindo caminho para assistentes de codificação locais, ferramentas de pesquisa, automação de fluxos de trabalho e aplicações privadas construídas sobre um modelo projetado para agir.
Configurações de hardware e resultados de desempenho
Os testes preliminares mediram o desempenho do Muse Glimmer 30B em duas configurações de hardware AMD, ambas funcionando no Windows com o projeto llama.cpp.
| Hardware | Tokens por segundo |
| AMD Ryzen AI Max+ 395 | 24 |
| AMD Radeon AI PRO R9700 (dFlash ativado) | 53 |
O backend Vulkan e a decodificação especulativa dFlash foram os componentes de software utilizados nas medições.
Otimizações adicionais de software e modelo já estão em andamento, e a expectativa é que o desempenho continue melhorando conforme o ecossistema amadurece.
O PC Agente como plataforma de inteligência persistente
O conceito de PC Agente representa a evolução dos dispositivos que aceleram funcionalidades individuais de IA para plataformas capazes de hospedar inteligência persistente.
Os PCs Agentes baseados em AMD Ryzen AI Max+ e as placas de vídeo Radeon AI PRO R9700 são dois caminhos de hardware recomendados para transformar esse futuro em realidade.
O llama.cpp fornece a fundação de inferência, o LM Studio viabiliza o acesso ao modelo para o consumidor, e o Lemonade resolve a integração dentro de aplicações.
A combinação dessas três camadas converte a capacidade agente local de uma ideia promissora em aplicação prática executada diretamente na mesa do usuário.
Leia mais
- AMD Zen 6 pode ter recursos de controle de núcleos para melhorar 1% lows em jogos
- AMD Ryzen Chipset Driver 8.07.16.1035 lançado com correção de bugs
- MSI lança mini PC com AMD Ryzen AI MAX+ 395
O que é um modelo de IA agente e por que executá-lo localmente
Aos que estão por fora do assunto, uma breve contextualização: um modelo de IA agente funciona como um assistente digital que não apenas responde perguntas, mas executa tarefas com várias etapas.
A tecnologia mantém um histórico do que está fazendo (contexto), toma decisões em sequência, utiliza programas e ferramentas por conta própria, verifica se os resultados estão corretos e ajusta o rumo quando algo falha. É diferente de um chatbot tradicional, que apenas reage a cada mensagem isoladamente.
Executar esse tipo de modelo localmente significa que ele roda no PC do próprio usuário, sem enviar dados para servidores na nuvem.
Isso resolve três problemas muito importantes: os arquivos e senhas não saem da máquina, não há atrasos causados pela comunicação com servidores distantes, e não se paga a cada uso (como acontece com serviços de IA baseados em nuvem que cobram por token processado).
O modelo descrito nesta matéria, o Muse Glimmer 30B, é um cérebro artificial de uso geral com 30 bilhões de parâmetros ajustáveis, treinado para esse tipo de trabalho contínuo, que pode ser usado, modificado e até revendido por qualquer pessoa ou empresa graças à licença Apache 2.0.
O hardware da AMD fornece a potência necessária para que ele funcione com fluidez diretamente em PCs caseiros e estações de trabalho.
E aí? O que achou da novidade? Compartilhe o seu ponto de vista nesta publicação e continue acompanhando o Adrenaline!
Fonte: Site oficial
