Os EUA O Instituto de Segurança da Inteligência Artificial (US AISI) e o Instituto de Segurança da Inteligência Artificial (Reino Unido AISI) realizaram uma avaliação conjunta pré- implantação do último modelo Anthropic- o atualizado Claude 3.5 Sonnet (lançado em outubro __ZXQNUMD_, __ZXQNUME_). O seguinte é uma visão geral de alto nível das avaliações realizadas, bem como um instantâneo dos achados de cada domínio testado. Um relatório técnico mais detalhado pode ser encontrado aqui. Visão geral do exercício conjunto de pesquisa e teste de segurança. US AISI e Reino Unido AISI realizaram testes durante um período limitado de acesso pré- implantação ao modelo Sonnet __ZXQNUMF_ atualizado. Os testes foram realizados por engenheiros especialistas, cientistas e especialistas em assuntos da equipe de ambos os Institutos, e os achados foram compartilhados com Anthropic antes do modelo ser divulgado publicamente. US AISI e Reino Unido AISI executaram testes separados mas complementares para avaliar as capacidades do modelo em quatro domínios: (1) capacidades biológicas, (2) capacidades cibernéticas, (3) software e desenvolvimento de IA, e (4) salvaguardam a eficácia.

Para avaliar as capacidades relativas do modelo e avaliar os potenciais impactos do mundo real do Sonnet __ZXQNUMK atualizado ___ nestas quatro áreas, o US AISI e o Reino Unido AISI compararam o seu desempenho com uma série de modelos de referência semelhantes: a versão anterior do Sonet AnthropicÕs 3.5, o OpenAIÕs o 1 _-preview e o OpenAIÕs GPT-__ZXQNUMN_o. Estas comparações são destinadas apenas a avaliar as melhorias relativas da capacidade do Sonnet 3.5, a fim de melhorar a interpretação científica dos resultados da avaliação. US AISI e Reino Unido AISI testaram o Sonnet atualizado 3.5, utilizando uma variedade de técnicas, incluindo: Resposta às Perguntas: O modelo foi solicitado para responder corretamente a uma série de perguntas que testam conhecimento ou resolução de problemas em um determinado tópico. As respostas foram mais frequentemente classificadas automaticamente por outro modelo, verificadas por um humano com conhecimento das respostas corretas.

Tarefas do Agente: O modelo operava como um agente em um ambiente virtual onde lhe foi dada uma tarefa a completar, providenciada com acesso a uma série de ferramentas de software, e incitou a dar uma série de passos até que ele completasse com sucesso a tarefa ou atingisse o seu número máximo de passos sem ter sucesso. Prova qualitativa: Um perito científico analisou um modelo enquanto operava para entender suas capacidades e limitações em mais detalhes. Red Teaming: Especialistas em aprendizado de máquina tentaram desenvolver jailbreaks ou outras entradas adversas que fariam com que o modelo respondesse a pedidos maliciosos. Avaliações e achados. Abaixo estão os achados selecionados do teste AISI e Reino Unido AISIÕs do modelo Sonnet 3.5 atualizado. Note que diferenças menores no desempenho do modelo apresentado abaixo podem cair dentro das margens de erro para estes testes. Mais detalhes podem ser encontrados no relatório técnico.

Capacidades biológicas. Os rápidos avanços na IA estão possibilitando uma inovação poderosa em muitos campos de pesquisa biológica, o que tem imensa promessa para o futuro da ciência, da medicina, da fabricação e muito mais. Dito isto, muitas descobertas biológicas e capacidades são de duplo uso, o que significa que novas descobertas no campo da biologia podem ser usadas para facilitar resultados úteis, assim como potenciais prejudiciais. Para entender melhor as capacidades biológicas relativas do Sonnet 3.5 atualizado, incluindo como ele poderia ser utilizado indevidamente, o US AISI e Reino Unido AISI focaram- se em avaliar como o modelo se realizou em uma série de tarefas de pesquisa prática. Abaixo está uma visão geral de alto nível dos achados relacionados às capacidades biológicas. Por favor, note que esses achados são baseados apenas no teste do US AISI, uma vez que o Reino Unido AISI não está publicando seus achados neste domínio neste momento.

US AISI avaliou o Sonnet 3.5 atualizado em um conjunto de questões de pesquisa de múltipla escolha, e o desempenho foi comparável aos modelos de referência e significativamente abaixo das linhas de base dos especialistas humanos na maioria dos casos. US AISI pilotou um método de avaliação que aumenta o modelo de IA fornecendo- lhe acesso a ferramentas bioinformáticas para ajudar em questões de tarefa de pesquisa, que quando testadas usando Sonnet 3.5 resultaram em um aumento do desempenho além do modelo sozinho, às vezes excedendo as linhas de base mensuradas dos peritos humanos. Os avanços nos sistemas de IA podem permitir a automação de tarefas cibernéticas cada vez mais complexas. Estas capacidades também são de duplo uso, o que significa que podem ser alavancadas para fortalecer as ciberdefesas e também podem ser usadas maliciosamente para explorar um sistema informático.

Para entender melhor a capacidade relativa do Sonnet 3.5 atualizado, o US AISI e o Reino Unido AISI avaliaram como o modelo foi executado em uma gama de habilidades cibernéticas que poderiam ser usadas para habilitar tarefas maliciosas, como hackear um sistema informático. US AISI avaliou o Sonnet 3.5 atualizado contra um conjunto de desafios de segurança cibernética __ZXQNUMW_ disponíveis ao público. O modelo atualizado foi capaz de resolver com sucesso 32.5% de todas as tarefas, em comparação com uma taxa de resolução 35% para o modelo de referência mais eficiente avaliado. Reino Unido AISI avaliou o Soneto Claude 3.5 upgraded contra um conjunto de desafios de cibersegurança 47, 15 dos quais estão disponíveis ao público e 32 dos quais foram desenvolvidos privadamente. O modelo atualizado foi capaz de resolver 36% de tarefas que estão no nível de competência do aprendiz de cibersegurança, em comparação com 29% de tarefas no mesmo nível para o melhor modelo de referência avaliado.

Avaliações de Desenvolvimento de Software e IA. Os sistemas de AI estão se tornando ferramentas cada vez mais úteis para engenheiros que estão desenvolvendo essas tecnologias. Mesmo que um sistema de IA não seja capaz de completar uma tarefa dada por si mesmo, ele poderá ser implementado para ajudar a desenvolver ou aumentar outro software para torná- lo mais capaz. Pondo simplesmente, o sistema AI avançado pode tornar as tecnologias existentes mais eficazes. Para compreender o impacto relativo do Sonnet __ZXQNUMAF atualizado nas tarefas de desenvolvimento de software e IA, o US AISI e Reino Unido AISI configuraram o modelo como um agente automatizado com acesso a várias ferramentas básicas de desenvolvimento de software e testaram sua habilidade e capacidade para executar tarefas de engenharia comuns. US AISI avaliou o Sonnet 3.5 atualizado contra uma coleção de desafios disponíveis ao público em que um agente deve melhorar a qualidade ou velocidade de um modelo ML. Em uma escala de 0% (modelo não melhorado) para 100% (nível máximo de melhoria do modelo pelos humanos), o modelo recebeu uma pontuação média de 57% _ melhoração – em comparação com uma média de 48% melhoria pelo modelo de referência mais eficaz avaliado.

Reino Unido AISI avaliou o Sonnet 3.5 atualizado em um conjunto de avaliações desenvolvidas em privado que consistem em engenharia de software, raciocínio geral e tarefas de agente que abrangem uma ampla gama de níveis de dificuldade. O modelo atualizado teve uma taxa de sucesso de 66% em tarefas de engenharia de software em comparação com 64% pelo melhor modelo de referência avaliado, e uma taxa de sucesso de 47% em tarefas de raciocínio geral em comparação com 35% pelo melhor modelo de referência avaliado. Muitos desenvolvedores de AI constroem salvaguardas em seus sistemas para detectar e, em seguida, impedir que o modelo responda a pedidos potencialmente prejudiciais dos usuários. Tais salvaguardas são uma linha de defesa importante, embora seja atualmente possível para os usuários contorná- los através de uma gama de entradas adversas que fariam o modelo responder pedidos maliciosos, conhecidos como ‘jailbreaks. Para testar a eficácia das salvaguardas do Sonnet atualizado 3.5, o US AISI e o Reino Unido AISI em equipe vermelha atualizaram o Sonnet 3.5 para determinar a sua robustez contra tais fugas de prisão.

Embora as avaliações de salvaguardas dos EUA e do Reino Unido sejam destinadas a informar como os desenvolvedores podem proteger melhor os sistemas de IA de serem deliberadamente utilizados indevidamente, vale a pena destacar que tais salvaguardas não são a única medida que os provedores de modelos podem usar para prevenir o uso indevido, e os resultados desta avaliação não podem por si só determinar os riscos do modelo. Além disso, o que se qualifica como um pedido prejudicial é frequentemente subjetivo. Os diferentes fornecedores de modelos têm diferentes abordagens para definir o uso aceitável dos seus modelos, e essas abordagens diferem entre jurisdições e contextos locais – incluindo entre os Estados Unidos e o Reino Unido. US AISI testou o Sonnet 3.5 atualizado contra uma série de jailbreaks disponíveis para o público, e na maioria dos casos a versão incorporada das salvaguardas que US AISI testou foi contornada como resultado, o que significa que o modelo forneceu respostas que deveriam ter sido evitadas. Isto é consistente com pesquisas anteriores sobre a vulnerabilidade de outros sistemas de IA. O Reino Unido AISI testou o Sonnet 3.5 atualizado usando uma série de jailbreaks públicos e privados e também encontrou a versão das salvaguardas que o Reino Unido AISI testou pode ser rotineiramente contornada. Isto é novamente consistente com pesquisas anteriores sobre a vulnerabilidade de outros sistemas de IA.

Enquanto estes testes foram realizados de acordo com as melhores práticas atuais, os achados devem ser considerados preliminares. Estes testes foram realizados em um período de tempo limitado com recursos finitos, que, se estendidos, poderiam expandir o escopo dos achados e as conclusões subsequentes tiradas. A ciência da segurança da IA é um campo novo e em rápida evolução. A realização dessas avaliações independentes de segurança melhora a precisão e robustez das avaliações futuras para que os governos possam ficar à frente dos riscos e das capacidades à medida que emergem. US AISI e Reino Unido AISI planejam iterar e expandir o escopo de avaliação, metodologia e ferramentas de teste em exercícios adicionais. Aguardamos feedback da comunidade científica para ajudar a fortalecer este trabalho crítico e a promover a ciência da segurança da IA. O relatório técnico pode ser encontrado aqui. Este blog foi publicado através do Instituto de Segurança da IA do Reino Unido.