BLOG

Cisco lanza sistema gratuito para verificar procedencia de modelos IA de código abierto

Cisco Lanza un Sistema Gratuito para Verificar la Procedencia de Modelos de IA de Código Abierto

La inteligencia artificial de código abierto vive un momento de expansión sin precedentes. Millones de modelos circulan por plataformas como Hugging Face, descargados y desplegados en entornos productivos por empresas de todo el mundo. Sin embargo, detrás de este ecosistema vibrante se esconde una brecha de seguridad crítica que hasta ahora nadie había resuelto de forma sistemática: nadie verificaba de dónde venían realmente esos modelos. Cisco acaba de cambiar esa realidad con una herramienta gratuita y accesible para todos.

El problema que nadie quería ver: la cadena de suministro de IA sin verificación

Cuando un equipo de seguridad empresarial evalúa si un modelo de inteligencia artificial de código abierto es seguro para su uso en producción, ¿en qué se basa? Hasta ahora, la respuesta era inquietante: en una etiqueta de texto que alguien escribió en un formulario. Así de simple y así de peligroso.

Hugging Face, la plataforma líder en distribución de modelos de IA, superó los 2 millones de modelos públicos en la primavera de 2026. Para documentar el origen de cada modelo, la plataforma utiliza un campo denominado base_model, que los propios usuarios rellenan manualmente sin ningún tipo de verificación técnica. No existe análisis de pesos, no hay comprobación criptográfica, ni ningún proceso automatizado que confirme que el modelo realmente desciende del origen que declara.

Esta fragilidad estructural tiene consecuencias directas para la seguridad corporativa. Si se descubre una vulnerabilidad crítica en un modelo base ampliamente utilizado, identificar qué modelos productivos heredan esa debilidad requiere un proceso manual de rastreo entre repositorios con etiquetas que nadie ha verificado. Es como intentar rastrear el origen de un brote alimentario sin registros sanitarios.

Lo que reveló el Informe ATOM: dominancia sin trazabilidad

El Informe ATOM (Analyzing Trends in Open Models), publicado en abril de 2026 por Nathan Lambert y Florian Brand en Interconnects AI, puso cifras concretas a este problema. El estudio rastreó aproximadamente 1.500 modelos principales en Hugging Face y sus conclusiones fueron reveladoras y preocupantes a partes iguales.

Según el informe, el 69% de todos los modelos derivados declara pertenecer a la familia Qwen de Alibaba como modelo base, una cifra que ascendió desde apenas el 1% en enero de 2024. Los laboratorios chinos en conjunto representan el 70% de los modelos base de los cuales se derivan nuevos modelos, mientras que Europa apenas alcanza el 4%. Las descargas acumuladas de modelos rastreados en las tres regiones principales alcanzaron 2.040 millones hasta marzo de 2026.

Estos datos ilustran no solo la dominancia tecnológica de determinados actores geopolíticos, sino también la escala del problema de verificación. Con semejante concentración de dependencia en familias de modelos específicas, una sola vulnerabilidad no detectada podría propagarse a cientos de miles de despliegues productivos sin que nadie lo supiera a tiempo.

La solución de Cisco: el AI Supply Chain Provenance Explorer

Cisco ha respondido a este vacío con el lanzamiento del AI Supply Chain Provenance Explorer, una base de datos pública y completamente gratuita disponible en provenance.aidefense.cisco.com que cubre casi 900 modelos de inteligencia artificial de código abierto. La herramienta reemplaza el sistema de etiquetas autodeclaradas por un análisis técnico riguroso basado en similitud de pesos computacionales: la llamada “huella digital” de los modelos.

La iniciativa parte del Model Provenance Kit, un conjunto de herramientas Python de código abierto publicado inicialmente en abril de 2026 que cubría aproximadamente 150 modelos base de más de 45 familias y más de 20 editores. Con el lanzamiento del Explorer, la cobertura se amplió aproximadamente seis veces en un solo trimestre, alcanzando casi 900 modelos. Además, la versión anterior requería entorno Python local, descarga de pesos de decenas de gigabytes y horas de trabajo de ingeniería por modelo. El Explorer elimina toda esa fricción: los resultados ya están calculados y son consultables directamente desde un navegador web.

Cómo funciona la huella digital: dos etapas de análisis técnico

El proceso técnico que sustenta el Explorer opera en dos etapas claramente diferenciadas, diseñadas para maximizar la precisión minimizando el coste computacional.

Etapa 1 — Metadatos de arquitectura: El sistema compara los metadatos de arquitectura del modelo antes de cargar ningún peso. Si los metadatos son suficientemente claros para determinar el linaje, el proceso termina aquí. Si son ambiguos, se activa la segunda etapa.

Etapa 2 — Cinco señales a nivel de pesos: Cuando la arquitectura no ofrece respuestas concluyentes, el sistema analiza cinco señales extraídas directamente de los pesos del modelo. La Embedding Anchor Similarity mide relaciones geométricas que sobreviven al proceso de ajuste fino. La Embedding Norm Distribution captura patrones de frecuencia de palabras. El Norm Layer Fingerprint analiza capas que permanecen estables tras el fine-tuning. El Layer Energy Profile examina las distribuciones a lo largo de la profundidad de la red. Por último, el Weight-Value Cosine realiza una comparación directa de valores de pesos: modelos entrenados de forma independiente muestran una correlación esencialmente nula en esta métrica.

Es importante destacar una decisión técnica deliberada: los tokens se excluyen de la puntuación de procedencia, aunque se calculan con fines diagnósticos. La razón es evitar falsos positivos. StableLM y Pythia, por ejemplo, comparten el mismo tokenizador GPT-NeoX sin compartir ningún peso, por lo que incluir esta señal generaría acusaciones erróneas de parentesco entre modelos completamente independientes.

Resultados: precisión del 96,4% con un enfoque conservador

El sistema fue evaluado en un benchmark propio de 111 pares de modelos con un umbral de similitud de 0,70. Los resultados arrojaron una precisión del 96,4% y un F1 de 0,963. Solo cuatro pares fueron clasificados incorrectamente, todos ellos implicando transformaciones arquitectónicas extremas que Cisco reconoce abiertamente como un límite fundamental del análisis comparativo de pesos.

La filosofía que guía el diseño del sistema es conservadora por razones éticas y legales bien fundamentadas. La Constitución de Procedencia de Modelos de Cisco establece que, por defecto, los pares ambiguos se etiquetan como independientes. El razonamiento es claro: un falso positivo implicaría acusar erróneamente a un equipo de infringir una licencia, con consecuencias reputacionales y legales graves. Un falso negativo, en cambio, puede detectarse durante la revisión manual posterior. Esta decisión conservadora es, en gran medida, la que sustenta la alta precisión reportada.

Más allá del análisis estático: detectar cambios de identidad en tiempo de ejecución

El Explorer no se limita al análisis estático de pesos. También integra análisis de similitud conductual, basado en investigaciones de Jonah Leshin, Manish Shah e Ian Timmis del Proyecto VAIL, en colaboración con Daniel Kang de la Universidad de Illinois. Su trabajo sobre la estabilidad de endpoints conductuales demuestra que un modelo puede mantenerse operativo mientras su identidad efectiva cambia a través de actualizaciones de pesos, procesos de cuantización o mecanismos de enrutamiento entre modelos.

Este enfoque conductual complementa el análisis estático de forma significativa. Mientras que la huella digital de pesos establece el linaje en el momento del análisis, el seguimiento conductual permite detectar si un modelo ha cambiado su comportamiento efectivo a lo largo del tiempo, algo que ningún sistema de etiquetas autodeclaradas podría jamás capturar.

La brecha en el análisis antimalware: otro problema resuelto parcialmente

El problema de verificación en la cadena de suministro de IA no se limita al linaje de los modelos. Cisco Foundation AI ya realizaba escaneos de todos los archivos públicos subidos a Hugging Face mediante una versión actualizada del motor ClamAV, mostrando una insignia de estado por archivo. Sin embargo, la propia documentación de Hugging Face advierte que un archivo puede no mostrar ninguna insignia porque todavía está en cola, en proceso de escaneo, o porque el escaneo generó un error.

Esto significa que, al revisar un modelo en un momento determinado, parte de sus archivos pueden no tener resultados de escaneo completados. La cobertura del análisis antimalware había sido, en la práctica, una suposición, no un atributo verificable antes de aprobar un modelo para producción. El Explorer contribuye a cerrar esta brecha ofreciendo un contexto de procedencia que, combinado con el análisis de malware, permite una evaluación de riesgos más completa y fundamentada.

Implicaciones para los equipos de seguridad empresarial

Para los equipos de seguridad que gestionan el despliegue de modelos de IA en entornos productivos, el Explorer representa un cambio cualitativo en sus capacidades de evaluación. Por primera vez, existe una fuente técnicamente verificada, gratuita y accesible que permite responder preguntas críticas: ¿De qué modelo base desciende realmente este modelo que queremos desplegar? ¿Comparte linaje con modelos que han tenido vulnerabilidades documentadas? ¿Su comportamiento ha cambiado desde la última evaluación?

La herramienta no elimina la necesidad de procesos de revisión manual, pero sí transforma radicalmente el punto de partida. En lugar de comenzar con una etiqueta autodeclarada que podría ser incorrecta o incluso deliberadamente engañosa, los equipos de seguridad pueden iniciar su análisis con datos técnicos verificados independientemente.

Un paso necesario hacia la madurez de la cadena de suministro de IA

El lanzamiento del AI Supply Chain Provenance Explorer por parte de Cisco llega en un momento en que la industria comienza a tomar en serio la seguridad de la cadena de suministro de inteligencia artificial. La analogía con la seguridad del software tradicional es directa: igual que la industria tardó años en reconocer la importancia de verificar la procedencia de las bibliotecas de código abierto, el ecosistema de IA está comenzando a enfrentar preguntas similares sobre los modelos que integra en sus sistemas.

Cisco ha dado un paso importante al ofrecer esta herramienta de forma gratuita y pública, democratizando el acceso a capacidades de verificación que hasta ahora solo estaban al alcance de organizaciones con recursos técnicos muy significativos. El siguiente desafío será lograr que estos mecanismos de verificación se conviertan en un estándar de facto en el proceso de adopción de modelos de IA, no en una práctica opcional reservada a los más cautelosos.

En un ecosistema donde el 69% de los modelos deriva de una sola familia sin verificación técnica independiente, herramientas como el Explorer no son un lujo para equipos de seguridad avanzados. Son una necesidad básica para cualquier organización que tome en serio la gestión de riesgos en la era de la inteligencia artificial.

De la idea a la estrategia

Las grandes empresas no crecen solo con ideas, sino con ejecución estratégica. En Reinvente diseñamos sistemas de marketing, ventas e inteligencia artificial que convierten tu visión en resultados medibles.

Envíanos un mensaje de WhatsApp

Gerencia
Gerencia

Online

Offline

Asistente
Asistente

Online

Offline