Piauí lleva una IA de 30.000 millones de parámetros al Estado: la escala anunciada aún necesita pruebas abiertas
Soberano 1 encabeza un ecosistema comercial brasileño para educación, seguridad, atención y gestión pública. Hay productos, una API, una alianza público-privada y un memorando con Serpro; todavía no hay una ficha técnica pública que permita auditar las grandes afirmaciones sobre el modelo.
El estado de Piauí convirtió una iniciativa local de investigación en una oferta comercial para gobiernos de todo Brasil. El 19 de mayo, el ecosistema SoberanIA presentó Soberano 1: un gran modelo de lenguaje diseñado para el portugués y el trabajo administrativo, anunciado con 30.000 millones de parámetros y respaldado por un acervo que, según sus responsables, alcanzó 500.000 millones de tokens.
El lanzamiento importa porque no se limita a un chatbot. Combina modelo, API, aplicaciones, datos, infraestructura y canales públicos de distribución. También conecta a una administración subnacional con Serpro y Telebras, dos piezas centrales del Estado digital brasileño, además de AWS y Oracle. Es una apuesta poco común en América Latina por controlar más capas de la cadena de IA.
Pero el tamaño de la promesa supera la evidencia abierta. Hasta el cierre documental de este artículo no encontramos una ficha del modelo, informe técnico, pesos descargables, tabla completa de evaluaciones, desglose del corpus, consumo de cómputo ni auditoría externa de Soberano 1. Esa ausencia no demuestra que el sistema falle; impide verificar de manera independiente que funciona como se afirma.
Piauí ya comercializa una plataforma brasileña de IA para el sector público y abrió un camino de cooperación federal; ahora necesita publicar la evidencia que permita distinguir soberanía verificable, desempeño técnico y valor público de una suma de grandes cifras y alianzas.
Qué salió al mercado —y qué sigue siendo una posibilidad
La oferta se organiza en seis productos. Gov Chat busca reunir el acceso a servicios públicos por aplicación, web y WhatsApp. BO Fácil recibe por voz o texto la información para un boletín de ocurrencia y la somete a validación policial. Seduc AI genera materiales didácticos para docentes. Agentes SEI clasifica procesos administrativos y monitorea plazos. Un generador prepara términos de referencia para contrataciones. El sexto componente es una API con kit de desarrollo.
Soberano 1 se ofrece mediante API con cobro por token; los productos tienen precio bajo consulta y admiten esquemas por usuario o licencia integral, según la información del lanzamiento. Las opciones de alojamiento abarcan infraestructura del cliente, Serpro, Telebras y AWS. Por tanto, “usar SoberanIA” puede describir configuraciones técnicas y grados de control muy distintos.
El memorando firmado ese día por SoberanIA, la Empresa de Tecnología da Informação do Piauí y Serpro abre cuatro líneas: investigación en modelos grandes, pequeños y multimodales; validación y estudios de integración con Gov.br, SEI, Sigepe y e-SIC; cooperación sobre datos en portugués; y formación y búsqueda conjunta de recursos.
Es importante leer literalmente el alcance. “Estudios prospectivos de integración” no significan que el modelo ya opere dentro de esos sistemas federales. La propia comunicación señala que una eventual disposición comercial de activos se definirá en instrumentos posteriores. El memorando crea una vía; no equivale a despliegue, contrato federal ni validación terminada.
La trayectoria que sí puede reconstruirse
Una adenda revela la alianza de desarrollo
Piauí Instituto de Tecnologia modifica una asociación estratégica con DW Deepwin Tecnologia. El objeto incluye evolucionar la IA de Piauí Oportunidades y desarrollar SoberanIA; la vigencia publicada llega al 31 de diciembre de 2026.
Se documenta el Dataset Jabuticaba
Investe Piauí informa más de 130.000 millones de unidades textuales y fija como meta llegar a 500.000 millones de tokens en diciembre de 2025 y a un billón al final de 2026.
El balance oficial registra un modelo preliminar
El informe anual del Gobierno contabiliza 669 GB y más de 130.000 millones de tokens limpios y sin duplicados, el lanzamiento de Soberano 1 Preview y un acuerdo de cooperación con el MCTI.
Piauí y Serpro preparan una cooperación
Entidades estatales presentan el proyecto a la empresa federal y discuten infraestructura, interoperabilidad, formación y posibles aplicaciones nacionales.
Soberano 1 entra en fase comercial
El ecosistema anuncia 30.000 millones de parámetros, un acervo de 500.000 millones de tokens, seis productos, API y un memorando con Serpro.
La secuencia respalda que hubo desarrollo continuado y no solamente una presentación aislada. También muestra por qué los números necesitan versión y procedencia: el balance de 2025 documenta 130.000 millones de tokens, mientras que la web comercial de 2026 declara 500.000 millones. La expansión es compatible con la meta anterior, pero falta una ficha que indique qué se añadió, cuándo, bajo qué licencias y qué versión del corpus alimentó cada etapa del modelo.
30.000 millones de parámetros no son una calificación
Los parámetros son valores aprendidos durante el entrenamiento; dan una idea de escala y de requerimientos de memoria, pero no miden por sí solos exactitud, utilidad ni seguridad. Un modelo menor puede superar a uno mayor en una tarea especializada. Un modelo grande puede responder con fluidez y aun así inventar una norma, perder un plazo o interpretar mal una variante regional del portugués.
Los tokens tampoco equivalen a conocimiento confiable. Son unidades de texto que el sistema procesa. Un corpus de 500.000 millones puede contener diversidad útil o repetición, material desactualizado, datos de baja calidad y ejemplos que reaparecen en las pruebas. Además, la cifra publicada describe el acervo: sin un informe de entrenamiento no sabemos qué fracción utilizó Soberano 1, cuántas veces la recorrió ni cómo se mezclaron sus fuentes.
Los responsables afirman que el modelo superó a alternativas comparables en portugués y obtuvo resultados próximos a sistemas de mayor escala, entre ellos Gemini 3.1. La afirmación fue difundida por medios del sector, pero no encontramos la tabla, las tareas, las versiones de los rivales, las instrucciones, los parámetros de inferencia, los intervalos de error ni los resultados por categoría.
Sin esos elementos, la comparación no es reproducible. Tampoco puede descartarse contaminación —que una pregunta de prueba esté dentro del corpus— ni saberse si evaluó escritura administrativa, recuperación de información, razonamiento, seguridad o solamente preguntas de conocimiento. “Mejor” necesita sujeto, tarea, métrica, fecha y margen de incertidumbre.
La documentación mínima que falta alrededor del modelo
Identidad y arquitectura
Versión, fecha, arquitectura, modelo base si existe, longitud de contexto, tokenizador, idiomas, cuantizaciones, requisitos de inferencia y componentes externos.
Entrenamiento
Tokens realmente utilizados, mezcla de datos, fases de preentrenamiento y ajuste, hardware, horas de cómputo, energía, fallas conocidas y responsables de cada fase.
Evaluaciones reproducibles
Conjuntos públicos o auditables, resultados completos, comparación justa, control de contaminación, variación estadística, evaluación humana y pruebas independientes.
Riesgos y límites
Alucinaciones, sesgos, lenguas y dialectos, privacidad, memorización, ciberseguridad, instrucciones maliciosas, usos excluidos y controles que no deben sustituir supervisión.
Derechos y acceso
Propiedad de pesos y código, licencia, acceso para investigación, términos de API, retención de entradas, uso de consultas para entrenamiento, portabilidad y procedimiento de retirada.
Historial de versiones
Cambios de comportamiento, datos o filtros; fecha de cada despliegue; compatibilidad; reevaluación; incidentes y aviso a entidades cuando una actualización altera resultados.
El sitio del proyecto explica funciones y ofrece un centro de ayuda para cuentas, chat y API. Eso facilita el uso, pero no sustituye una ficha del modelo. Una documentación comercial responde cómo conectarse; una documentación científica y de gobernanza permite decidir si conviene hacerlo.
El corpus es infraestructura pública, no una cifra decorativa
La página de SoberanIA agrupa sus fuentes en datos públicos, gubernamentales y jurídicos, enciclopedias, periodismo, literatura, poesía y música. También declara más de 70.000 millones de tokens procedentes del Sistema Eletrônico de Informações, con el objetivo de comprender procesos y documentos oficiales. Afirma que los datasets cuentan con licencias jurídicas.
Una licencia general declarada no permite auditar el conjunto. Para hacerlo se necesita un inventario por fuente y versión: volumen, fecha de captura, permiso, condiciones de reutilización, tratamiento de duplicados, idioma, calidad, retiro de datos personales, exclusión de material reservado y mecanismo para corregir o eliminar registros. No hace falta publicar documentos protegidos; sí documentar su procedencia y gobierno.
El SEI vuelve el asunto especialmente relevante. El sistema contiene desde actos públicos hasta expedientes con restricciones y datos personales. La cifra agregada no explica qué categorías entraron al corpus, si los textos estaban abiertos al público, qué base legal se aplicó, qué anonimización hubo o si esos tokens se utilizaron para entrenamiento, recuperación documental o ambos.
Brasil ya establece una regla útil. El artículo 23 de la LGPD exige que el poder público informe de manera clara y accesible la previsión legal, finalidad, procedimientos y prácticas de sus tratamientos de datos personales. Una ficha de datos de SoberanIA podría convertir esa obligación general en trazabilidad concreta para cada producto.
La soberanía de la plataforma es híbrida y debe medirse por capas
SoberanIA se presenta como una tecnología creada y mantenida en Brasil, con procesamiento y almacenamiento nacionales. Al mismo tiempo, las comunicaciones del lanzamiento identifican a AWS como socio de nube durante el entrenamiento, a Oracle como socio comercial, a Telebras como operador de la sala segura para datos sensibles y a Serpro como posible infraestructura y canal público.
No es una contradicción automática. Un sistema puede ejecutarse dentro del territorio y usar tecnología extranjera; puede alojar datos en una estatal y entrenarse en una nube global; puede controlar sus aplicaciones sin tener una licencia abierta del modelo. La palabra “soberana” resume decisiones diferentes que deben evaluarse por separado.
- Datos
- Quién decide su uso, dónde permanecen, qué transferencias ocurren y quién puede borrarlos.
- Modelo
- Quién posee pesos, código y mejoras; quién puede inspeccionarlos, modificarlos y operarlos.
- Cómputo
- Dónde se ejecuta cada fase y qué ocurre si un proveedor cambia precio, licencia o acceso.
- Operación
- Qué personal local puede mantener, asegurar, actualizar y recuperar el servicio.
- Contratación
- Costos totales, interoperabilidad, auditoría, portabilidad, competencia y plan de salida.
- Gobernanza
- Quién responde ante una falla, un derecho vulnerado o una decisión de producto.
Una medición por capas evitaría dos errores opuestos: llamar dependiente a cualquier proyecto que use un proveedor global o llamar soberano a todo servicio cuyos servidores estén en Brasil. La autonomía relevante es la capacidad de decidir, verificar, sustituir y continuar.
La asociación público-privada necesita un mapa de derechos
El expediente público revisado identifica al Piauí Instituto de Tecnologia como contratante y a DW Deepwin Tecnologia como asociado en el Contrato de Parceria Estratégica 001/2025. La adenda confirma que el desarrollo de SoberanIA forma parte del objeto y prolonga el cronograma hasta el final de 2026. El extracto no publica el contrato íntegro, un valor ni la distribución de propiedad intelectual.
Esa distribución importa ahora que el producto se cobra por token y puede licenciarse a otros gobiernos. El público necesita saber qué activos pertenecen al Estado, qué derechos tiene la empresa, cómo se reparten ingresos, quién paga infraestructura, quién responde por soporte y seguridad, y qué ocurre con modelos, datos y clientes cuando termina la asociación.
Transparencia no obliga a revelar código protegido ni condiciones comercialmente sensibles sin justificación. Sí exige poder seguir el dinero y la autoridad: qué se financió con recursos públicos, quién puede explotarlo, qué recibe el Estado, qué obligaciones son auditables y cómo puede continuar el servicio sin una dependencia irremplazable.
Cada producto necesita su propia prueba
| Producto | Valor que promete | Falla que debe medirse | Salvaguarda mínima |
|---|---|---|---|
| Gov Chat | Encontrar servicios y completar consultas. | Ruta inventada, respuesta desactualizada o abandono. | Fuentes visibles, fecha, derivación humana y tasa de resolución. |
| BO Fácil | Reducir tiempo y desplazamiento al registrar hechos. | Transcripción errónea, omisión o clasificación inadecuada. | Lectura y corrección por la persona, validación policial y canal alternativo. |
| Seduc AI | Acelerar materiales didácticos adaptados. | Contenido falso, sesgo cultural o nivel pedagógico incorrecto. | Autoría docente, fuentes, rúbrica por asignatura y prueba de aprendizaje. |
| Agentes SEI | Clasificar expedientes y vigilar plazos. | Documento omitido, acceso excesivo o plazo perdido. | Permisos mínimos, registro de acciones, muestreo humano y alertas redundantes. |
| Generador de TR | Reducir el tiempo de preparar una contratación. | Especificación sesgada, norma falsa o requisito restrictivo. | Revisión jurídica y técnica, procedencia de cláusulas y comparación con borrador humano. |
La validación humana que anuncia BO Fácil es una protección importante, pero no convierte automáticamente el sistema en seguro. Debe medirse si la revisión detecta errores, cuánto tiempo añade, si la persona puede corregir la transcripción y qué sucede cuando el canal automático no entiende su voz, conectividad o forma de expresarse.
Brasil acaba de publicar el examen que esta plataforma debería pasar
El GuIA Unificado de Inteligencia Artificial para el Sector Público, publicado por el Gobierno Digital, organiza el ciclo de un proyecto en siete etapas: prospección, estructuración, experimentación, implementación, despliegue, sostenimiento y desactivación. En cada etapa pide verificaciones de LGPD, impacto ético, riesgo, responsables, métricas y evidencia documentada para auditoría.
Su anexo para sistemas generativos con grandes modelos va más allá de recomendaciones generales. Pide caracterizar el sistema, evaluar calidad, operación y experiencia, controlar versiones, aplicar barreras de seguridad y realizar pruebas adversariales. Es exactamente la transición que SoberanIA necesita: de afirmar que el modelo es seguro, eficiente o adecuado a publicar cómo midió cada atributo.
Para una administración compradora, el orden correcto comienza antes del modelo. Debe definir el problema y una línea base, demostrar por qué IA supera una regla o mejora de proceso, experimentar con datos representativos, comparar costo total, evaluar consecuencias sobre personas y fijar un criterio de no despliegue. El proveedor aporta evidencia; la entidad pública conserva la responsabilidad.
El artículo 20 de la LGPD añade derechos cuando una decisión que afecta intereses se toma únicamente mediante tratamiento automatizado: la persona puede solicitar revisión e información clara sobre criterios y procedimientos. Cuando hay intervención humana real, esa hipótesis específica puede no aplicarse, pero siguen vigentes los deberes de finalidad, necesidad, seguridad y transparencia. Poner una firma humana al final no basta si nadie tiene tiempo, información o autoridad para contradecir al sistema.
Ocho publicaciones que convertirían escala en confianza
Pueden proteger secretos legítimos y aun permitir control público.
01Ficha de Soberano 1 e informe técnico+
Arquitectura, entrenamiento, versiones, hardware, límites, licencia y responsables, con información suficiente para entender qué es realmente el modelo de 30.000 millones.
02Resultados completos de evaluación+
Tareas, datos, versiones comparadas, instrucciones, métricas, resultados por grupo, salidas de muestra, contaminación y validación de un equipo sin conflicto comercial.
03Ficha versionada del corpus+
Fuentes y proporciones, licencias, fechas, datos personales, desduplicación, filtros, exclusiones, solicitudes de retirada y relación entre Jabuticaba, SEI y el total anunciado.
04Contrato y mapa de propiedad+
Versión pública del acuerdo PIT–Deepwin, aportes, costos, ingresos, propiedad intelectual, derechos de explotación, obligaciones, auditoría y continuidad al terminar la alianza.
05Arquitectura de soberanía por modalidad+
Flujo de datos y control para alojamiento propio, Serpro, Telebras y AWS; proveedores, jurisdicción, cifrado, telemetría, dependencia técnica, portabilidad y plan de salida.
06Registro de despliegues públicos+
Entidad, problema, versión, datos, finalidad y base legal, riesgo, responsable humano, evaluación previa, fecha, proveedor, costo, incidentes y mecanismo de reclamación.
07Indicadores de cada producto+
Línea base, exactitud y error, finalización del servicio, tiempo y costo, revisión humana, accesibilidad, diferencias territoriales y poblacionales, satisfacción y efecto final.
08Incidentes, cambios y retiro+
Registro de fallas y correcciones, notificación a clientes, umbrales de suspensión, conservación de evidencia, revalidación después de actualizaciones y proceso ordenado de desactivación.
Por qué Piauí puede cambiar la conversación regional
La mayoría de las administraciones latinoamericanas entra a la IA en la capa final: compra una aplicación, habilita un asistente o contrata una nube. Piauí intenta construir datos, modelo, herramientas y distribución. Que ese esfuerzo surja de un estado del nordeste brasileño, y no solamente del gobierno federal o de São Paulo, también desafía la concentración geográfica de capacidad tecnológica.
Un modelo especializado en portugués y procesos administrativos podría reducir barreras lingüísticas, adaptar servicios al derecho local y formar equipos que comprendan la tecnología más allá de su interfaz. Una plataforma pública reutilizable también podría evitar que cada municipio pague por desarrollar desde cero las mismas funciones.
La posibilidad regional depende de que la evidencia viaje. Pesos abiertos no son la única forma de apertura: un proveedor puede proteger activos y aun publicar metodología, resultados, riesgos, contratos, métricas e incidentes. Sin esa capa, otros gobiernos solo pueden comprar la promesa; con ella, pueden comparar, aprender y exigir mejores condiciones.
SoberanIA también ofrece una prueba conceptual para América Latina: la autonomía no se alcanza reemplazando el nombre de una empresa extranjera por una marca nacional. Se alcanza cuando las instituciones pueden comprender el sistema, gobernar sus datos, negociar proveedores, corregir errores, proteger derechos y conservar capacidad después de que termina un contrato.
El próximo gran lanzamiento debe ser la evidencia
Piauí ya reunió ingredientes que pocas iniciativas públicas de la región muestran al mismo tiempo: continuidad institucional, un corpus propio, un modelo grande, productos presentados como operativos, canales de comercialización y una puerta hacia la infraestructura federal. Es suficiente para tratar Soberano 1 como una noticia importante, no como una maqueta.
También es suficiente para elevar el estándar. Un sistema que clasifica expedientes, redacta documentos de compra, produce materiales educativos o recibe información policial no puede evaluarse por el número de parámetros. Importan sus errores, quién los detecta, quién puede reclamar, cuánto cuesta corregirlos y si el servicio mejora frente a una alternativa más simple.
El éxito de SoberanIA no debería medirse por parecerse a un modelo global, sino por ofrecer algo que una plataforma pública brasileña puede hacer mejor: rendir cuentas en el idioma, la ley y las instituciones para las que fue creada. Publicar la ficha del modelo, las pruebas, el gobierno del corpus y los resultados de cada despliegue sería el paso que convierta sus cifras en infraestructura de confianza.
Los parámetros describen escala, no competencia
- Qué significa
- Un parámetro es un valor ajustado durante el entrenamiento. Contarlos ayuda a describir arquitectura y demanda de cómputo, pero no revela por sí solo exactitud, cobertura lingüística, seguridad ni costo por respuesta.
- Cómo aplica aquí
- Los 30.000 millones sitúan a Soberano 1 en una categoría de tamaño. Para un servicio público importa más si resuelve la tarea concreta, cita normas vigentes, funciona con lenguaje regional y admite corrección.
- La medida decisiva
- Una evaluación reproducible con versión, conjunto de prueba no contaminado, criterios humanos, incertidumbre, resultados por región y comparación con modelos más pequeños y con el proceso sin IA.
Pregunta de control: ¿otra persona puede repetir la prueba?+
Para hacerlo necesita la versión exacta, instrucciones, ejemplos de evaluación, métrica, reglas de puntuación y resultados desagregados. Un porcentaje sin ese paquete no permite comparar ni detectar regresiones.
Qué permite afirmar la evidencia
Soberano 1 existe como modelo anunciado de 30.000 millones de parámetros dentro de una plataforma orientada al sector público. Su tamaño y disponibilidad comercial son hechos verificables; calidad, seguridad, costo total y grado real de soberanía requieren documentación reproducible.
Sí está respaldado
El Gobierno de Piauí y sus socios presentan un modelo de 30.000 millones de parámetros, una API y productos para organismos públicos.
Base: Portal oficial de SoberanIA, documentación de la plataforma y balance estatal
La iniciativa se apoya en el corpus Jabuticaba y en una asociación público-privada entre PIT y Deepwin.
Base: Anuncios del Gobierno de Piauí y adenda de la asociación
Aún no está demostrado
- El número de parámetros no demuestra precisión, utilidad, ausencia de sesgo, eficiencia ni superioridad frente a modelos alternativos.
- La información disponible no permite reconstruir por completo licencias del corpus, evaluaciones independientes, costos de inferencia o derechos sobre pesos y mejoras.
Tres señales que pueden cambiar la evaluación
Seguimiento, no predicción- 01
Evaluación reproducible
Resultados por tarea, idioma, región y grupo, con conjunto de prueba documentado y comparación contra bases pertinentes.
- 02
Mapa de derechos y dependencias
Licencias de datos y código, titularidad de pesos, nube, hardware, operadores y condiciones de salida del proveedor.
- 03
Pruebas por servicio público
Exactitud, costo, latencia, quejas y revisión humana medidos por separado en cada producto, no solo en el modelo base.