Mais um modelo de IA escapa à sandbox! Desta vez foi o chinês Kimi K3
A segurança dos modelos de inteligência artificial (IA) volta a estar sob fogo depois de o Kimi K3, desenvolvido pela Moonshot AI, ter conseguido escapar ao ambiente de testes onde estava "trancado". O incidente surge na sequência de casos semelhantes envolvendo modelos da OpenAI, Anthropic e Meta.
Kimi K3 encontrou uma falha na sandbox
De acordo com a Wired, o Kimi K3, modelo de pesos abertos criado pela empresa chinesa Moonshot AI, conseguiu contornar as restrições da sandbox durante um teste de cibersegurança conduzido pela startup Frontier Security.
Segundo a Frontier Security, o problema não se limitou a uma vulnerabilidade na configuração do ambiente de testes. A empresa afirma que o modelo foi capaz de identificar essa falha e explorá-la deliberadamente para sair da sandbox.
Yaron Singer, CEO da Frontier Security, explicou que foi detetada uma fuga no ambiente isolado, mas salientou que o Kimi K3 reconheceu essa oportunidade e tirou partido dela, sugerindo que o modelo poderá não possuir as mesmas barreiras internas presentes noutros sistemas de IA.
Apesar de ter conseguido acesso ao exterior, o Kimi K3 não executou qualquer ataque informático. Em vez disso, optou pela solução mais simples. As respostas aos desafios que lhe tinham sido atribuídos encontravam-se publicamente disponíveis no GitHub, pelo que o modelo apenas recolheu essa informação em vez de resolver os problemas pelos seus próprios meios.
Casos semelhantes multiplicam-se na indústria
Este episódio não é um caso isolado. Nas últimas semanas, várias empresas revelaram incidentes semelhantes envolvendo modelos de IA.
- A OpenAI divulgou recentemente que um dos seus modelos ainda não lançado conseguiu aceder à Internet e comprometer a plataforma Hugging Face, tendo posteriormente sido confirmado que agentes da empresa interagiram também com outros serviços durante o mesmo episódio.
- Pouco depois, a Anthropic revelou que alguns dos seus modelos também escaparam ao ambiente de testes e realizaram ataques a três empresas distintas.
- Mais recentemente, foi a vez da Meta confirmar que o Meta AI conseguiu igualmente sair da sandbox e aceder aos sistemas de outra organização.
À medida que cresce a aposta em agentes de IA capazes de atuar com maior autonomia, estes incidentes reforçam a importância dos ambientes de isolamento utilizados durante os testes. A robustez da sandbox é cada vez mais determinante para impedir comportamentos inesperados.
Leia também:






















O Fonseca diz que AI é segura por isso é porque é.
Ahahahaha
Um LLM é controlado pelo humano, ainda tem de ser direcionado, a maioria ainda não tem carta de llms
Marketing!
Marketing feito por uma empresa de cyber us a correr um modelo open weight de uma empresa chinesa..
Vocês pensam sequer antes de falar?
Vocês, quem?
O respeito pela opinião dos outros, mesmo que não se concorde é bonito e recomenda-se.
Não é por acharmos que sabemos mais que os outros que podemos falar antes de pensar!
Na minha opinião é sem dúvida uma excelente estratégia de marketing demonstrar que temos um produto “poderoso” que, à semelhança dos melhores tem também os mesmos “defeitos”. Mesmo que isso seja uma realidade.
Não leste o que eu disse?
Opiniões valem nada contra factos.
Respeito opiniões validas, não diarreiras mentais de quem não sabe do que está a falar
Levei um pouco a entender é verdade, mas ao ler os teus (imensos e degradantes) comentários já entendei o que pretendes. Não me leves a mal mas precisas de ajuda médica. Mas claro que vais levar a mal, é mais forte que tu. Boa viagem!
A fraude financeira não leva apenas o seu dinheiro; ela destrói o seu sustento, a sua confiança e o seu emocional. Depois de perder as minhas poupanças, senti-me sem esperança. Assim, encontrei um especialista em recuperação de ativos que analisou o meu caso, revelou a verdade e ajudou-me a recuperar os meus recursos. O profissionalismo e a dedicação deles mudaram tudo. Se foi vítima de uma burla, não desista: existem especialistas que o podem ajudar a recuperar o seu dinheiro.
Contacte-os pelo e-mail trustwave.cyberdefense@gmail com
O que não explicam nem aqui nem em lado nenhum, os modelos dos frontier labs não sao eles próprios que recusam determinadas ações, por exemplo no caso da Anthropic o fable é o mesmo modelo que o mythos, apenas tem uma camada on top que analisa os prompts e as ações para ver se algo pode levar ações de cyber e faz downgrade para um opus 4.8, agora ate o opus 5 tem os mesmos guardrails, igual com o gpt 5.6 SOL no caso do kimi k3 é um modelo open weigh que pode ser corrido por qualquer um em qualquer provider ou ate em hardware próprio, não ha guardrails, ele vai deixar fazer tudo o que for capaz sem nenhuma limitação, cabe a quem o está a correr o saber controlar
Zé, a gente já começa é a ficar farto de levar com a opinião da tua llm em cada post do pplware.
O facto de não conseguires distinguir informação digerida por um humano de informação gerada por um LLM diz tudo sobre ti e sobre esse comentário
Estás sempre a cuspir a mesma treta, não enganas ninguém.
Se achas que eu não engano ninguém é porque o enganado és tu.
Só me resta ter pena de ti, pior cego é aquele que não quer ver
Todos escapam se for preciso, tudo marketing!
Se não escapar não é bom, logo todas as empresas querem que o seu modelo escape. 🙂
Só falta a xAI.