Saltar al contenido
Montevive

/ Blog /

Noticias

Montevive

Shieldstral ya funciona en tu navegador. ¿Y en tus idiomas?

·Chema Robles·Inteligencia Artificial, Ciberseguridad
Shieldstral ya funciona en tu navegador. ¿Y en tus idiomas?

Imagen generada con IA (gpt-image-2)

Mistral publicó hace una semana Shieldstral, un modelo abierto que decide si un texto infringe una política de seguridad. Para ejecutarlo hace falta una GPU de 16 GB.

Lo hemos convertido para que funcione dentro de una pestaña del navegador, en tu propio ordenador, sin que nada salga de tu red. Puedes probarlo ahora mismo:

labs.montevive.ai/shieldstral-policy-probe

¿Por qué te importa esto?

Si tu empresa ha desplegado un filtro entre tus empleados y las herramientas de IA públicas, o está a punto de hacerlo, tienes un problema incómodo: no tienes forma de comprobar que funciona.

Normalmente auditar un control de IA implica una prueba de concepto, un ciclo de compras y, casi siempre, mandar contenido real de tu empresa al servidor de un tercero para ver qué responde. Es exactamente lo que la mayoría de responsables de seguridad no puede permitirse.

Que el modelo corra en el navegador cambia esa ecuación. Puedes pegar tus propios textos, en tus propios idiomas, y ver la respuesta al instante. Sin contrato, sin integración y sin que un solo dato salga de tu equipo.

Así que hicimos esa auditoría nosotros primero.

Lo que medimos

Le hicimos la misma pregunta al modelo, con la misma política y el mismo umbral, sobre 1.392 textos en cada uno de los cinco idiomas en los que trabaja España: castellano, catalán, euskera, gallego e inglés. Textos idénticos, traducidos y verificados. Lo único que cambiaba era el idioma.

Mistral documenta doce idiomas para este modelo. El castellano está en esa lista. El catalán, el euskera y el gallego no.

Lo que encontramos

Detecta bien, hasta que cambias de idioma. De cada 100 mensajes dañinos, el modelo detectó:

  • Inglés: 82
  • Castellano: 80
  • Catalán: 79
  • Gallego: 78
  • Euskera: 59

Mismo texto, misma política, mismo umbral. Uno de cada cinco idiomas deja pasar el doble de contenido que el resto.

Y nunca te habrías enterado. Este es el punto importante para cualquier CISO. Un filtro que bloquea de más se detecta solo: los empleados se quejan el primer día. Un filtro que deja pasar de más es invisible.

En nuestras pruebas, las falsas alarmas se mantuvieron entre el 2,3% y el 3,2% en los cinco idiomas. El modelo nunca se volvió ruidoso. No había ninguna señal, en ningún panel, que indicara que en uno de los idiomas la detección se había desplomado. El control seguía en verde.

Los valores por defecto están afinados para el idioma que mejor conoce. Estos modelos traen un umbral recomendado de fábrica. Al ajustarlo, la detección en euskera subió del 59% al 71%. En inglés, el mismo ajuste solo aportó tres puntos. Desplegar con la configuración de serie penaliza precisamente a los idiomas que peor lleva.

Cuánto empeora depende de cómo lo midas. Repetimos el experimento con dos conjuntos de pruebas distintos y la diferencia entre ellos fue mayor que la diferencia entre idiomas. Medir esto bien es más difícil de lo que parece, y una cifra sin metodología detrás no significa gran cosa. Hemos publicado la nuestra completa.

Compruébalo tú mismo

Abre la demo, escribe una política en lenguaje normal y pulsa «Run all five». Verás la misma frase evaluada en los cinco idiomas a la vez, y verás uno de ellos volver limpio mientras los otros cuatro se marcan.

Treinta segundos. Nada se transmite.

Conseguirlo no fue trivial: las herramientas estándar de conversión no soportan esta arquitectura, así que tuvimos que hacer la exportación a mano y verificar que el modelo del navegador da exactamente los mismos resultados que el original. Hemos publicado los pesos en abierto y la metodología completa por si quieres reproducirlo.

Cuatro preguntas para tu proveedor de IA

Si compras o renuevas cualquier control de seguridad basado en IA, estas cuatro preguntas separan a los proveedores serios del resto:

  1. ¿En qué idiomas está medido, y cuál es la tasa de detección? No la precisión ni la exactitud: el porcentaje de contenido dañino que captura. Son métricas distintas y solo una te dice qué se te escapa.
  2. ¿Qué ocurre con un idioma que no está en vuestra lista? «No está soportado» y «funciona peor, y esto es cuánto» son respuestas muy diferentes.
  3. ¿Qué umbral viene configurado por defecto, quién lo ajustó y para qué idioma?
  4. ¿Puedo probarlo con mi propio contenido, en mis idiomas, antes de firmar? Si la respuesta exige una prueba de concepto de tres meses, es una respuesta.

Lo que esto no te dice

Hemos medido un modelo concreto, con una política concreta. Otros filtros tendrán otros perfiles, y el objetivo de este artículo no es señalar a Shieldstral, que es un trabajo notable y de código abierto.

Además, nuestras traducciones al catalán, euskera y gallego se generaron automáticamente y están pendientes de revisión por hablantes nativos. Los controles que aplicamos indican que el efecto es real, pero preferimos decirlo antes de que nos lo pregunten.

Por qué nos importa a nosotros

En Montevive construimos sistemas de IA para organizaciones que no pueden entregar sus datos a la nube de otro. Nuestro producto, Moviwa, se coloca entre un equipo y los asistentes que ya utiliza, y evita que salga material confidencial. Para eso tiene que leer bien lo que escriben tus empleados, y tus empleados escriben en castellano, catalán, euskera y gallego, a veces en el mismo documento.

Por eso medimos antes de desplegar, y por eso publicamos lo que encontramos.

Contacta con nosotros si quieres revisar qué controles de IA tienes y si están funcionando de verdad.