América
Latina
Investigación documentalBrasil · Piauí

Piauí lleva una IA de 30.000 millones de parámetros al Estado: la escala anunciada aún necesita pruebas abiertas

Soberano 1 encabeza un ecosistema comercial brasileño para educación, seguridad, atención y gestión pública. Hay productos, una API, una alianza público-privada y un memorando con Serpro; todavía no hay una ficha técnica pública que permita auditar las grandes afirmaciones sobre el modelo.

16 min de lectura
30B
Parámetros anunciados · desempeño independiente aún no publicado
30.000Mde parámetros atribuidos a Soberano 1
500.000Mde tokens declarados en el acervo en portugués
6productos ofrecidos a entidades públicas

El estado de Piauí convirtió una iniciativa local de investigación en una oferta comercial para gobiernos de todo Brasil. El 19 de mayo, el ecosistema SoberanIA presentó Soberano 1: un gran modelo de lenguaje diseñado para el portugués y el trabajo administrativo, anunciado con 30.000 millones de parámetros y respaldado por un acervo que, según sus responsables, alcanzó 500.000 millones de tokens.

El lanzamiento importa porque no se limita a un chatbot. Combina modelo, API, aplicaciones, datos, infraestructura y canales públicos de distribución. También conecta a una administración subnacional con Serpro y Telebras, dos piezas centrales del Estado digital brasileño, además de AWS y Oracle. Es una apuesta poco común en América Latina por controlar más capas de la cadena de IA.

Pero el tamaño de la promesa supera la evidencia abierta. Hasta el cierre documental de este artículo no encontramos una ficha del modelo, informe técnico, pesos descargables, tabla completa de evaluaciones, desglose del corpus, consumo de cómputo ni auditoría externa de Soberano 1. Esa ausencia no demuestra que el sistema falle; impide verificar de manera independiente que funciona como se afirma.

La noticia, en una frase

Piauí ya comercializa una plataforma brasileña de IA para el sector público y abrió un camino de cooperación federal; ahora necesita publicar la evidencia que permita distinguir soberanía verificable, desempeño técnico y valor público de una suma de grandes cifras y alianzas.

Qué salió al mercado —y qué sigue siendo una posibilidad

La oferta se organiza en seis productos. Gov Chat busca reunir el acceso a servicios públicos por aplicación, web y WhatsApp. BO Fácil recibe por voz o texto la información para un boletín de ocurrencia y la somete a validación policial. Seduc AI genera materiales didácticos para docentes. Agentes SEI clasifica procesos administrativos y monitorea plazos. Un generador prepara términos de referencia para contrataciones. El sexto componente es una API con kit de desarrollo.

Soberano 1 se ofrece mediante API con cobro por token; los productos tienen precio bajo consulta y admiten esquemas por usuario o licencia integral, según la información del lanzamiento. Las opciones de alojamiento abarcan infraestructura del cliente, Serpro, Telebras y AWS. Por tanto, “usar SoberanIA” puede describir configuraciones técnicas y grados de control muy distintos.

El memorando firmado ese día por SoberanIA, la Empresa de Tecnología da Informação do Piauí y Serpro abre cuatro líneas: investigación en modelos grandes, pequeños y multimodales; validación y estudios de integración con Gov.br, SEI, Sigepe y e-SIC; cooperación sobre datos en portugués; y formación y búsqueda conjunta de recursos.

Es importante leer literalmente el alcance. “Estudios prospectivos de integración” no significan que el modelo ya opere dentro de esos sistemas federales. La propia comunicación señala que una eventual disposición comercial de activos se definirá en instrumentos posteriores. El memorando crea una vía; no equivale a despliegue, contrato federal ni validación terminada.

De corpus estatal a plataforma comercial

La trayectoria que sí puede reconstruirse

  1. Una adenda revela la alianza de desarrollo

    Piauí Instituto de Tecnologia modifica una asociación estratégica con DW Deepwin Tecnologia. El objeto incluye evolucionar la IA de Piauí Oportunidades y desarrollar SoberanIA; la vigencia publicada llega al 31 de diciembre de 2026.

  2. Se documenta el Dataset Jabuticaba

    Investe Piauí informa más de 130.000 millones de unidades textuales y fija como meta llegar a 500.000 millones de tokens en diciembre de 2025 y a un billón al final de 2026.

  3. El balance oficial registra un modelo preliminar

    El informe anual del Gobierno contabiliza 669 GB y más de 130.000 millones de tokens limpios y sin duplicados, el lanzamiento de Soberano 1 Preview y un acuerdo de cooperación con el MCTI.

  4. Piauí y Serpro preparan una cooperación

    Entidades estatales presentan el proyecto a la empresa federal y discuten infraestructura, interoperabilidad, formación y posibles aplicaciones nacionales.

  5. Soberano 1 entra en fase comercial

    El ecosistema anuncia 30.000 millones de parámetros, un acervo de 500.000 millones de tokens, seis productos, API y un memorando con Serpro.

La secuencia respalda que hubo desarrollo continuado y no solamente una presentación aislada. También muestra por qué los números necesitan versión y procedencia: el balance de 2025 documenta 130.000 millones de tokens, mientras que la web comercial de 2026 declara 500.000 millones. La expansión es compatible con la meta anterior, pero falta una ficha que indique qué se añadió, cuándo, bajo qué licencias y qué versión del corpus alimentó cada etapa del modelo.

30.000 millones de parámetros no son una calificación

Los parámetros son valores aprendidos durante el entrenamiento; dan una idea de escala y de requerimientos de memoria, pero no miden por sí solos exactitud, utilidad ni seguridad. Un modelo menor puede superar a uno mayor en una tarea especializada. Un modelo grande puede responder con fluidez y aun así inventar una norma, perder un plazo o interpretar mal una variante regional del portugués.

Los tokens tampoco equivalen a conocimiento confiable. Son unidades de texto que el sistema procesa. Un corpus de 500.000 millones puede contener diversidad útil o repetición, material desactualizado, datos de baja calidad y ejemplos que reaparecen en las pruebas. Además, la cifra publicada describe el acervo: sin un informe de entrenamiento no sabemos qué fracción utilizó Soberano 1, cuántas veces la recorrió ni cómo se mezclaron sus fuentes.

Los responsables afirman que el modelo superó a alternativas comparables en portugués y obtuvo resultados próximos a sistemas de mayor escala, entre ellos Gemini 3.1. La afirmación fue difundida por medios del sector, pero no encontramos la tabla, las tareas, las versiones de los rivales, las instrucciones, los parámetros de inferencia, los intervalos de error ni los resultados por categoría.

Sin esos elementos, la comparación no es reproducible. Tampoco puede descartarse contaminación —que una pregunta de prueba esté dentro del corpus— ni saberse si evaluó escritura administrativa, recuperación de información, razonamiento, seguridad o solamente preguntas de conocimiento. “Mejor” necesita sujeto, tarea, métrica, fecha y margen de incertidumbre.

Auditoría técnica

La documentación mínima que falta alrededor del modelo

01

Identidad y arquitectura

Versión, fecha, arquitectura, modelo base si existe, longitud de contexto, tokenizador, idiomas, cuantizaciones, requisitos de inferencia y componentes externos.

02

Entrenamiento

Tokens realmente utilizados, mezcla de datos, fases de preentrenamiento y ajuste, hardware, horas de cómputo, energía, fallas conocidas y responsables de cada fase.

03

Evaluaciones reproducibles

Conjuntos públicos o auditables, resultados completos, comparación justa, control de contaminación, variación estadística, evaluación humana y pruebas independientes.

04

Riesgos y límites

Alucinaciones, sesgos, lenguas y dialectos, privacidad, memorización, ciberseguridad, instrucciones maliciosas, usos excluidos y controles que no deben sustituir supervisión.

05

Derechos y acceso

Propiedad de pesos y código, licencia, acceso para investigación, términos de API, retención de entradas, uso de consultas para entrenamiento, portabilidad y procedimiento de retirada.

06

Historial de versiones

Cambios de comportamiento, datos o filtros; fecha de cada despliegue; compatibilidad; reevaluación; incidentes y aviso a entidades cuando una actualización altera resultados.

El sitio del proyecto explica funciones y ofrece un centro de ayuda para cuentas, chat y API. Eso facilita el uso, pero no sustituye una ficha del modelo. Una documentación comercial responde cómo conectarse; una documentación científica y de gobernanza permite decidir si conviene hacerlo.

El corpus es infraestructura pública, no una cifra decorativa

La página de SoberanIA agrupa sus fuentes en datos públicos, gubernamentales y jurídicos, enciclopedias, periodismo, literatura, poesía y música. También declara más de 70.000 millones de tokens procedentes del Sistema Eletrônico de Informações, con el objetivo de comprender procesos y documentos oficiales. Afirma que los datasets cuentan con licencias jurídicas.

Una licencia general declarada no permite auditar el conjunto. Para hacerlo se necesita un inventario por fuente y versión: volumen, fecha de captura, permiso, condiciones de reutilización, tratamiento de duplicados, idioma, calidad, retiro de datos personales, exclusión de material reservado y mecanismo para corregir o eliminar registros. No hace falta publicar documentos protegidos; sí documentar su procedencia y gobierno.

El SEI vuelve el asunto especialmente relevante. El sistema contiene desde actos públicos hasta expedientes con restricciones y datos personales. La cifra agregada no explica qué categorías entraron al corpus, si los textos estaban abiertos al público, qué base legal se aplicó, qué anonimización hubo o si esos tokens se utilizaron para entrenamiento, recuperación documental o ambos.

Brasil ya establece una regla útil. El artículo 23 de la LGPD exige que el poder público informe de manera clara y accesible la previsión legal, finalidad, procedimientos y prácticas de sus tratamientos de datos personales. Una ficha de datos de SoberanIA podría convertir esa obligación general en trazabilidad concreta para cada producto.

La soberanía de la plataforma es híbrida y debe medirse por capas

SoberanIA se presenta como una tecnología creada y mantenida en Brasil, con procesamiento y almacenamiento nacionales. Al mismo tiempo, las comunicaciones del lanzamiento identifican a AWS como socio de nube durante el entrenamiento, a Oracle como socio comercial, a Telebras como operador de la sala segura para datos sensibles y a Serpro como posible infraestructura y canal público.

No es una contradicción automática. Un sistema puede ejecutarse dentro del territorio y usar tecnología extranjera; puede alojar datos en una estatal y entrenarse en una nube global; puede controlar sus aplicaciones sin tener una licencia abierta del modelo. La palabra “soberana” resume decisiones diferentes que deben evaluarse por separado.

Datos
Quién decide su uso, dónde permanecen, qué transferencias ocurren y quién puede borrarlos.
Modelo
Quién posee pesos, código y mejoras; quién puede inspeccionarlos, modificarlos y operarlos.
Cómputo
Dónde se ejecuta cada fase y qué ocurre si un proveedor cambia precio, licencia o acceso.
Operación
Qué personal local puede mantener, asegurar, actualizar y recuperar el servicio.
Contratación
Costos totales, interoperabilidad, auditoría, portabilidad, competencia y plan de salida.
Gobernanza
Quién responde ante una falla, un derecho vulnerado o una decisión de producto.

Una medición por capas evitaría dos errores opuestos: llamar dependiente a cualquier proyecto que use un proveedor global o llamar soberano a todo servicio cuyos servidores estén en Brasil. La autonomía relevante es la capacidad de decidir, verificar, sustituir y continuar.

La asociación público-privada necesita un mapa de derechos

El expediente público revisado identifica al Piauí Instituto de Tecnologia como contratante y a DW Deepwin Tecnologia como asociado en el Contrato de Parceria Estratégica 001/2025. La adenda confirma que el desarrollo de SoberanIA forma parte del objeto y prolonga el cronograma hasta el final de 2026. El extracto no publica el contrato íntegro, un valor ni la distribución de propiedad intelectual.

Esa distribución importa ahora que el producto se cobra por token y puede licenciarse a otros gobiernos. El público necesita saber qué activos pertenecen al Estado, qué derechos tiene la empresa, cómo se reparten ingresos, quién paga infraestructura, quién responde por soporte y seguridad, y qué ocurre con modelos, datos y clientes cuando termina la asociación.

Transparencia no obliga a revelar código protegido ni condiciones comercialmente sensibles sin justificación. Sí exige poder seguir el dinero y la autoridad: qué se financió con recursos públicos, quién puede explotarlo, qué recibe el Estado, qué obligaciones son auditables y cómo puede continuar el servicio sin una dependencia irremplazable.

Una plataforma, riesgos distintos

Cada producto necesita su propia prueba

ProductoValor que prometeFalla que debe medirseSalvaguarda mínima
Gov ChatEncontrar servicios y completar consultas.Ruta inventada, respuesta desactualizada o abandono.Fuentes visibles, fecha, derivación humana y tasa de resolución.
BO FácilReducir tiempo y desplazamiento al registrar hechos.Transcripción errónea, omisión o clasificación inadecuada.Lectura y corrección por la persona, validación policial y canal alternativo.
Seduc AIAcelerar materiales didácticos adaptados.Contenido falso, sesgo cultural o nivel pedagógico incorrecto.Autoría docente, fuentes, rúbrica por asignatura y prueba de aprendizaje.
Agentes SEIClasificar expedientes y vigilar plazos.Documento omitido, acceso excesivo o plazo perdido.Permisos mínimos, registro de acciones, muestreo humano y alertas redundantes.
Generador de TRReducir el tiempo de preparar una contratación.Especificación sesgada, norma falsa o requisito restrictivo.Revisión jurídica y técnica, procedencia de cláusulas y comparación con borrador humano.

La validación humana que anuncia BO Fácil es una protección importante, pero no convierte automáticamente el sistema en seguro. Debe medirse si la revisión detecta errores, cuánto tiempo añade, si la persona puede corregir la transcripción y qué sucede cuando el canal automático no entiende su voz, conectividad o forma de expresarse.

Brasil acaba de publicar el examen que esta plataforma debería pasar

El GuIA Unificado de Inteligencia Artificial para el Sector Público, publicado por el Gobierno Digital, organiza el ciclo de un proyecto en siete etapas: prospección, estructuración, experimentación, implementación, despliegue, sostenimiento y desactivación. En cada etapa pide verificaciones de LGPD, impacto ético, riesgo, responsables, métricas y evidencia documentada para auditoría.

Su anexo para sistemas generativos con grandes modelos va más allá de recomendaciones generales. Pide caracterizar el sistema, evaluar calidad, operación y experiencia, controlar versiones, aplicar barreras de seguridad y realizar pruebas adversariales. Es exactamente la transición que SoberanIA necesita: de afirmar que el modelo es seguro, eficiente o adecuado a publicar cómo midió cada atributo.

Para una administración compradora, el orden correcto comienza antes del modelo. Debe definir el problema y una línea base, demostrar por qué IA supera una regla o mejora de proceso, experimentar con datos representativos, comparar costo total, evaluar consecuencias sobre personas y fijar un criterio de no despliegue. El proveedor aporta evidencia; la entidad pública conserva la responsabilidad.

El artículo 20 de la LGPD añade derechos cuando una decisión que afecta intereses se toma únicamente mediante tratamiento automatizado: la persona puede solicitar revisión e información clara sobre criterios y procedimientos. Cuando hay intervención humana real, esa hipótesis específica puede no aplicarse, pero siguen vigentes los deberes de finalidad, necesidad, seguridad y transparencia. Poner una firma humana al final no basta si nadie tiene tiempo, información o autoridad para contradecir al sistema.

Rendición de cuentas

Ocho publicaciones que convertirían escala en confianza

Pueden proteger secretos legítimos y aun permitir control público.

01Ficha de Soberano 1 e informe técnico+

Arquitectura, entrenamiento, versiones, hardware, límites, licencia y responsables, con información suficiente para entender qué es realmente el modelo de 30.000 millones.

02Resultados completos de evaluación+

Tareas, datos, versiones comparadas, instrucciones, métricas, resultados por grupo, salidas de muestra, contaminación y validación de un equipo sin conflicto comercial.

03Ficha versionada del corpus+

Fuentes y proporciones, licencias, fechas, datos personales, desduplicación, filtros, exclusiones, solicitudes de retirada y relación entre Jabuticaba, SEI y el total anunciado.

04Contrato y mapa de propiedad+

Versión pública del acuerdo PIT–Deepwin, aportes, costos, ingresos, propiedad intelectual, derechos de explotación, obligaciones, auditoría y continuidad al terminar la alianza.

05Arquitectura de soberanía por modalidad+

Flujo de datos y control para alojamiento propio, Serpro, Telebras y AWS; proveedores, jurisdicción, cifrado, telemetría, dependencia técnica, portabilidad y plan de salida.

06Registro de despliegues públicos+

Entidad, problema, versión, datos, finalidad y base legal, riesgo, responsable humano, evaluación previa, fecha, proveedor, costo, incidentes y mecanismo de reclamación.

07Indicadores de cada producto+

Línea base, exactitud y error, finalización del servicio, tiempo y costo, revisión humana, accesibilidad, diferencias territoriales y poblacionales, satisfacción y efecto final.

08Incidentes, cambios y retiro+

Registro de fallas y correcciones, notificación a clientes, umbrales de suspensión, conservación de evidencia, revalidación después de actualizaciones y proceso ordenado de desactivación.

Por qué Piauí puede cambiar la conversación regional

La mayoría de las administraciones latinoamericanas entra a la IA en la capa final: compra una aplicación, habilita un asistente o contrata una nube. Piauí intenta construir datos, modelo, herramientas y distribución. Que ese esfuerzo surja de un estado del nordeste brasileño, y no solamente del gobierno federal o de São Paulo, también desafía la concentración geográfica de capacidad tecnológica.

Un modelo especializado en portugués y procesos administrativos podría reducir barreras lingüísticas, adaptar servicios al derecho local y formar equipos que comprendan la tecnología más allá de su interfaz. Una plataforma pública reutilizable también podría evitar que cada municipio pague por desarrollar desde cero las mismas funciones.

La posibilidad regional depende de que la evidencia viaje. Pesos abiertos no son la única forma de apertura: un proveedor puede proteger activos y aun publicar metodología, resultados, riesgos, contratos, métricas e incidentes. Sin esa capa, otros gobiernos solo pueden comprar la promesa; con ella, pueden comparar, aprender y exigir mejores condiciones.

SoberanIA también ofrece una prueba conceptual para América Latina: la autonomía no se alcanza reemplazando el nombre de una empresa extranjera por una marca nacional. Se alcanza cuando las instituciones pueden comprender el sistema, gobernar sus datos, negociar proveedores, corregir errores, proteger derechos y conservar capacidad después de que termina un contrato.

El próximo gran lanzamiento debe ser la evidencia

Piauí ya reunió ingredientes que pocas iniciativas públicas de la región muestran al mismo tiempo: continuidad institucional, un corpus propio, un modelo grande, productos presentados como operativos, canales de comercialización y una puerta hacia la infraestructura federal. Es suficiente para tratar Soberano 1 como una noticia importante, no como una maqueta.

También es suficiente para elevar el estándar. Un sistema que clasifica expedientes, redacta documentos de compra, produce materiales educativos o recibe información policial no puede evaluarse por el número de parámetros. Importan sus errores, quién los detecta, quién puede reclamar, cuánto cuesta corregirlos y si el servicio mejora frente a una alternativa más simple.

El éxito de SoberanIA no debería medirse por parecerse a un modelo global, sino por ofrecer algo que una plataforma pública brasileña puede hacer mejor: rendir cuentas en el idioma, la ley y las instituciones para las que fue creada. Publicar la ficha del modelo, las pruebas, el gobierno del corpus y los resultados de cada despliegue sería el paso que convierta sus cifras en infraestructura de confianza.

Clave técnica

Los parámetros describen escala, no competencia

Qué significa
Un parámetro es un valor ajustado durante el entrenamiento. Contarlos ayuda a describir arquitectura y demanda de cómputo, pero no revela por sí solo exactitud, cobertura lingüística, seguridad ni costo por respuesta.
Cómo aplica aquí
Los 30.000 millones sitúan a Soberano 1 en una categoría de tamaño. Para un servicio público importa más si resuelve la tarea concreta, cita normas vigentes, funciona con lenguaje regional y admite corrección.
La medida decisiva
Una evaluación reproducible con versión, conjunto de prueba no contaminado, criterios humanos, incertidumbre, resultados por región y comparación con modelos más pequeños y con el proceso sin IA.
Pregunta de control: ¿otra persona puede repetir la prueba?+

Para hacerlo necesita la versión exacta, instrucciones, ejemplos de evaluación, métrica, reglas de puntuación y resultados desagregados. Un porcentaje sin ese paquete no permite comparar ni detectar regresiones.

Lectura verificada

Qué permite afirmar la evidencia

Estado del casoPlataforma lanzada; evidencia técnica incompleta

Soberano 1 existe como modelo anunciado de 30.000 millones de parámetros dentro de una plataforma orientada al sector público. Su tamaño y disponibilidad comercial son hechos verificables; calidad, seguridad, costo total y grado real de soberanía requieren documentación reproducible.

Sí está respaldado

  • El Gobierno de Piauí y sus socios presentan un modelo de 30.000 millones de parámetros, una API y productos para organismos públicos.

    Base: Portal oficial de SoberanIA, documentación de la plataforma y balance estatal

  • La iniciativa se apoya en el corpus Jabuticaba y en una asociación público-privada entre PIT y Deepwin.

    Base: Anuncios del Gobierno de Piauí y adenda de la asociación

Aún no está demostrado

  • El número de parámetros no demuestra precisión, utilidad, ausencia de sesgo, eficiencia ni superioridad frente a modelos alternativos.
  • La información disponible no permite reconstruir por completo licencias del corpus, evaluaciones independientes, costos de inferencia o derechos sobre pesos y mejoras.

Tres señales que pueden cambiar la evaluación

Seguimiento, no predicción
  1. 01

    Evaluación reproducible

    Resultados por tarea, idioma, región y grupo, con conjunto de prueba documentado y comparación contra bases pertinentes.

  2. 02

    Mapa de derechos y dependencias

    Licencias de datos y código, titularidad de pesos, nube, hardware, operadores y condiciones de salida del proveedor.

  3. 03

    Pruebas por servicio público

    Exactitud, costo, latencia, quejas y revisión humana medidos por separado en cada producto, no solo en el modelo base.

Revisión editorial: 8 de agosto de 2026Consultar la base documental ↓
Cobertura abierta

¿Tienes una ficha técnica, evaluación o contrato que complete esta investigación?

Compartir evidencia