Quantcast

Mais um modelo de IA escapa à sandbox! Desta vez foi o chinês Kimi K3

15 Comentários

A segurança dos modelos de inteligência artificial (IA) volta a estar sob fogo depois de o Kimi K3, desenvolvido pela Moonshot AI, ter conseguido escapar ao ambiente de testes onde estava “trancado”. O incidente surge na sequência de casos semelhantes envolvendo modelos da OpenAI, Anthropic e Meta.

Kimi K3 encontrou uma falha na sandbox

De acordo com a Wired, o Kimi K3, modelo de pesos abertos criado pela empresa chinesa Moonshot AI, conseguiu contornar as restrições da sandbox durante um teste de cibersegurança conduzido pela startup Frontier Security.

Segundo a Frontier Security, o problema não se limitou a uma vulnerabilidade na configuração do ambiente de testes. A empresa afirma que o modelo foi capaz de identificar essa falha e explorá-la deliberadamente para sair da sandbox.

Yaron Singer, CEO da Frontier Security, explicou que foi detetada uma fuga no ambiente isolado, mas salientou que o Kimi K3 reconheceu essa oportunidade e tirou partido dela, sugerindo que o modelo poderá não possuir as mesmas barreiras internas presentes noutros sistemas de IA.

Apesar de ter conseguido acesso ao exterior, o Kimi K3 não executou qualquer ataque informático. Em vez disso, optou pela solução mais simples. As respostas aos desafios que lhe tinham sido atribuídos encontravam-se publicamente disponíveis no GitHub, pelo que o modelo apenas recolheu essa informação em vez de resolver os problemas pelos seus próprios meios.

Casos semelhantes multiplicam-se na indústria

Este episódio não é um caso isolado. Nas últimas semanas, várias empresas revelaram incidentes semelhantes envolvendo modelos de IA.

  • A OpenAI divulgou recentemente que um dos seus modelos ainda não lançado conseguiu aceder à Internet e comprometer a plataforma Hugging Face, tendo posteriormente sido confirmado que agentes da empresa interagiram também com outros serviços durante o mesmo episódio.
  • Pouco depois, a Anthropic revelou que alguns dos seus modelos também escaparam ao ambiente de testes e realizaram ataques a três empresas distintas.
  • Mais recentemente, foi a vez da Meta confirmar que o Meta AI conseguiu igualmente sair da sandbox e aceder aos sistemas de outra organização.

À medida que cresce a aposta em agentes de IA capazes de atuar com maior autonomia, estes incidentes reforçam a importância dos ambientes de isolamento utilizados durante os testes. A robustez da sandbox é cada vez mais determinante para impedir comportamentos inesperados.

 

Leia também:

Modelo de IA da Meta ligou-se à Internet sozinho e invadiu sistemas de outra empresa

Comentários

15

Deixe um comentário

O seu endereço de email não será publicado. Campos obrigatórios marcados com *

  1. Avatar de É preciso é calma
    É preciso é calma

    O Fonseca diz que AI é segura por isso é porque é.
    Ahahahaha

    1. Avatar de Zé Fonseca A.
      Zé Fonseca A.

      Um LLM é controlado pelo humano, ainda tem de ser direcionado, a maioria ainda não tem carta de llms

  2. Avatar de Ricardo A.
    Ricardo A.

    Marketing!

    1. Avatar de Zé Fonseca A.
      Zé Fonseca A.

      Marketing feito por uma empresa de cyber us a correr um modelo open weight de uma empresa chinesa..
      Vocês pensam sequer antes de falar?

      1. Avatar de Ricardo A.
        Ricardo A.

        Vocês, quem?
        O respeito pela opinião dos outros, mesmo que não se concorde é bonito e recomenda-se.
        Não é por acharmos que sabemos mais que os outros que podemos falar antes de pensar!
        Na minha opinião é sem dúvida uma excelente estratégia de marketing demonstrar que temos um produto “poderoso” que, à semelhança dos melhores tem também os mesmos “defeitos”. Mesmo que isso seja uma realidade.

        1. Avatar de Zé Fonseca A.
          Zé Fonseca A.

          Não leste o que eu disse?
          Opiniões valem nada contra factos.
          Respeito opiniões validas, não diarreiras mentais de quem não sabe do que está a falar

          1. Avatar de Ricardo A.
            Ricardo A.

            Levei um pouco a entender é verdade, mas ao ler os teus (imensos e degradantes) comentários já entendei o que pretendes. Não me leves a mal mas precisas de ajuda médica. Mas claro que vais levar a mal, é mais forte que tu. Boa viagem!

  3. Avatar de Jessica
    Jessica

    A fraude financeira não leva apenas o seu dinheiro; ela destrói o seu sustento, a sua confiança e o seu emocional. Depois de perder as minhas poupanças, senti-me sem esperança. Assim, encontrei um especialista em recuperação de ativos que analisou o meu caso, revelou a verdade e ajudou-me a recuperar os meus recursos. O profissionalismo e a dedicação deles mudaram tudo. Se foi vítima de uma burla, não desista: existem especialistas que o podem ajudar a recuperar o seu dinheiro.
    Contacte-os pelo e-mail trustwave.cyberdefense@gmail com

  4. Avatar de Zé Fonseca A.
    Zé Fonseca A.

    O que não explicam nem aqui nem em lado nenhum, os modelos dos frontier labs não sao eles próprios que recusam determinadas ações, por exemplo no caso da Anthropic o fable é o mesmo modelo que o mythos, apenas tem uma camada on top que analisa os prompts e as ações para ver se algo pode levar ações de cyber e faz downgrade para um opus 4.8, agora ate o opus 5 tem os mesmos guardrails, igual com o gpt 5.6 SOL no caso do kimi k3 é um modelo open weigh que pode ser corrido por qualquer um em qualquer provider ou ate em hardware próprio, não ha guardrails, ele vai deixar fazer tudo o que for capaz sem nenhuma limitação, cabe a quem o está a correr o saber controlar

    1. Avatar de André Silva
      André Silva

      Zé, a gente já começa é a ficar farto de levar com a opinião da tua llm em cada post do pplware.

      1. Avatar de Zé Fonseca A.
        Zé Fonseca A.

        O facto de não conseguires distinguir informação digerida por um humano de informação gerada por um LLM diz tudo sobre ti e sobre esse comentário

        1. Avatar de André Silva
          André Silva

          Estás sempre a cuspir a mesma treta, não enganas ninguém.

          1. Avatar de Zé Fonseca A.
            Zé Fonseca A.

            Se achas que eu não engano ninguém é porque o enganado és tu.
            Só me resta ter pena de ti, pior cego é aquele que não quer ver

  5. Avatar de Filipe
    Filipe

    Todos escapam se for preciso, tudo marketing!
    Se não escapar não é bom, logo todas as empresas querem que o seu modelo escape. 🙂

  6. Avatar de Luís
    Luís

    Só falta a xAI.