Anthropic Detalla Salvaguardas de Ciberseguridad y Marco de Jailbreak para Fable 5
El avanzado modelo de IA Fable 5 de Anthropic, ya disponible globalmente, refuerza su protección con clasificadores de seguridad y propone un nuevo marco para evaluar la severidad de los "jailbreaks".

Fable 5, el avanzado modelo de inteligencia artificial de Anthropic, ya está disponible globalmente para todos los usuarios. Con su lanzamiento, la compañía comparte detalles cruciales sobre sus salvaguardas de ciberseguridad y presenta un innovador marco para evaluar la severidad de los "jailbreaks" de IA, buscando establecer un estándar en la industria.
Estas "salvaguardas de ciberseguridad" son sistemas de IA complementarios que detectan y bloquean usos peligrosos o potencialmente peligrosos en el ámbito de la ciberseguridad. Anthropic ha delineado una lista detallada de los tipos de daños que los clasificadores de Fable 5 están diseñados para prevenir y aquellos que no.
Anthropic ha delineado una lista detallada de los tipos de daños que los clasificadores de Fable 5 están diseñados para prevenir y aquellos que no.
Un aspecto clave es el borrador inicial de su marco de severidad para "jailbreaks" de IA, desarrollado con los socios de Glasswing. Los "jailbreaks" son tácticas que buscan eludir las protecciones de un modelo, desbloqueando comportamientos como tareas de ciberseguridad potencialmente dañinas.
La severidad de estos "jailbreaks" varía considerablemente. Algunos solo desbloquean comportamientos indeseables menores, mientras que otros pueden habilitar una amplia gama de resultados perjudiciales, aumentando el riesgo del modelo. La falta de un marco estandarizado dificulta la comunicación consistente sobre estos riesgos entre desarrolladores y gobiernos.
Anthropic espera que esta iniciativa impulse un diálogo fructífero en la academia, la industria, la sociedad civil y el gobierno. Para fomentar la colaboración, la empresa lanzó un programa en HackerOne, invitando a investigadores de seguridad a reportar posibles "cyber jailbreaks" descubiertos en Fable 5.
La ciberseguridad presenta un desafío particular para las salvaguardas de IA debido a su naturaleza de "doble uso". Muchas capacidades pueden emplearse tanto para fines benignos como maliciosos. Por ejemplo, es deseable que los defensores cibernéticos usen modelos para escanear código en busca de vulnerabilidades, pero esta misma función podría ser el preámbulo de un ciberataque en manos equivocadas.
Para abordar esto, Fable 5 no bloquea todas las actividades relacionadas con la ciberseguridad. En su lugar, los clasificadores están entrenados para distinguir entre cuatro categorías de uso:
Uso Prohibido: Actividades con daño significativo y poca utilidad defensiva (ej. ransomware, desarrollo de malware). Se bloquean.
Doble Uso de Alto Riesgo: Actividades comunes en ciberseguridad ofensiva, pero también útiles para defensores (ej. hacking, pruebas de penetración). Se bloquean hasta tener mejores controles.
Doble Uso de Bajo Riesgo: Actividades predominantemente defensivas con algún valor para actores maliciosos (ej. inteligencia de código abierto, identificación de vulnerabilidades ya conocidas). Se monitorean y a veces se bloquean por precaución.
Uso Benigno: Actividades defensivas de TI con mínima posibilidad de abuso (ej. codificación segura, análisis de registros). Se permiten.
La categoría de "Doble Uso de Bajo Riesgo" se solapa con el "margen de seguridad" de Anthropic. Este margen implica que muchas acciones benignas se bloquean por precaución, asegurando que solo las solicitudes claramente seguras pasen los clasificadores. Para Fable 5, este margen se amplió respecto a modelos anteriores.

El marco propuesto para la severidad de los "cyber jailbreaks" (CJS) se clasifica en cinco niveles: CJS-0 (Informacional) hasta CJS-4 (Crítico). La evaluación se basa en cuatro ejes clave: la ganancia de capacidad (qué tan lejos lleva al atacante más allá de sus herramientas actuales), la amplitud de la ganancia de capacidad (cuántas tareas ofensivas distintas cubre), la facilidad de weaponización (esfuerzo para convertir el "jailbreak" en un ataque funcional) y la descubribilidad (qué tan fácil es obtener la técnica).
Este enfoque integral de Anthropic subraya la complejidad de la seguridad en la IA. La empresa busca establecer un estándar que permita el uso defensivo de esta tecnología, al tiempo que previene su uso indebido, un equilibrio crucial para el futuro de la inteligencia artificial.
Seguí leyendo online — escaneá el código
https://go.tricuatro.com/osj3o
© tricuatro.com
Temas de la nota
Notas relacionadas

TikTok prueba herramienta de IA para proteger creadores de deepfakes
La plataforma de videos está implementando una opción para que los usuarios verifiquen su identidad y reporten usos no autorizados de su imagen generados por inteligencia artificial.

Apple demanda a OpenAI por robo de secretos comerciales de hardware
La compañía de la manzana acusa a ex empleados clave, incluyendo a Tang Tan, de sustraer información confidencial para el beneficio de OpenAI y su expansión en hardware.

Anthropic aborda las preguntas clave sobre el futuro de la IA
La empresa lanza una iniciativa para entender las preocupaciones públicas y transparentar sus esfuerzos en el desarrollo responsable de la inteligencia artificial.
Últimas noticias
Ver todas
Chip del MIT convierte luz infrarroja invisible en información crucial
Investigadores del MIT desarrollaron un innovador chip que detecta metano y propano usando luz infrarroja media, con potencial para millones de píxeles y computación óptica.

Assassin's Creed Black Flag Resynced Supera 3 Millones de Ventas y Anuncia New Game Plus
El exitoso relanzamiento del clásico pirata de Ubisoft continúa rompiendo récords, confirmando una de las funciones más solicitadas por la comunidad de jugadores.

Tesla Lanza Réplica Eléctrica del Cybertruck para Niños en EE. UU.
Tesla presenta su Cybertruck a escala para niños de 6 a 12 años, un vehículo eléctrico de USD 1.500 que por ahora solo está disponible en el mercado estadounidense.
Comentarios (0)
Aún no hay comentarios. ¡Sé el primero!
Solo los lectores registrados pueden comentar.