Nuestra filosofia
Creemos que compartir datos para entrenar IA no deberia exponer informacion sensible. SynthGAN genera productos de datos plausibles que preservan propiedades estadisticas globales sin reproducir individuos reales.
La privacidad no es un anadido: es el punto de partida del diseno sintetico.
Seguridad por diseno
Datos no especificos, diagnosticos de rareza y metricas de privacidad integradas en cada ejecucion.
Validacion continua
Comparacion real vs sintetico: distribuciones, correlaciones, reglas logicas y consistencia.
Interoperabilidad
Exports CSV, Parquet y metadata JSON listos para catalogos, APIs y espacios de datos.
Que esperar del laboratorio
El laboratorio SynthGAN es la demo tecnica publica del proyecto. Permite subir un CSV de referencia o usar datasets demo y obtener un informe completo de generacion sintetica.
Si obtienes
- Perfilado automatico de tipos de variable y normalidad.
- Muestra sintetica con dependencias por correlaciones, parciales o betas.
- Informe HTML con graficos, diagnosticos y metricas de privacidad.
- Exports reproducibles con semilla fija y metadata trazable.
No es
- Una copia de registros reales ni una garantia de privacidad diferencial.
- Un sustituto de validacion clinica, regulatoria o legal.
- Un producto SaaS en produccion con autenticacion y SLA.
- Una decision automatica sobre uso de datos sin supervision humana.
Como funciona SynthGAN
Tres etapas desde el CSV de referencia hasta el producto de datos sintetico validado.
-
Entrada
CSV real de referencia, configuracion de muestra, semilla y metodo de dependencia.
-
Procesamiento
Perfilado, descubrimiento de reglas, modelado latente multinormal, transformaciones y muestreo.
-
Salida
Dataset sintetico, informe de validacion, exports y metadata para integracion en espacios de datos.
Pipeline synthmulti
Arquitectura del motor estadistico que impulsa el laboratorio.
Definir esquema
Tipos de variable, distribuciones marginales y restricciones inferidas del CSV.
Modelo latente
Normal multivariante con correlaciones, parciales o betas segun parametrizacion elegida.
Transformar y muestrear
Variables continuas, binarias, ordinales y categoricas con reglas logicas post-proceso.
Diagnosticar y exportar
Comparacion estadistica, privacidad, metadata versionada y archivos interoperables.
Para quien
| Perfil | Valor |
|---|---|
| Salud y longevidad | Cohortes sinteticas para investigacion sin exponer datos clinicos reales. |
| Administracion publica | Simulacion de politicas y planificacion con datos agregados seguros. |
| Espacios de datos | Productos interoperables con metadatos para catalogos y hubs europeos. |
| Equipos de IA | Entrenamiento, QA y validacion con datasets no sensibles y reproducibles. |
Documentacion y recursos
Materiales tecnicos del proyecto. Los datasets demo son sinteticos o de dominio publico; no contienen informacion sensible y no deben usarse para decisiones automatizadas sin validacion.
Ficha tecnica SynthGAN
Capacidades del motor, uso del laboratorio y advertencias de uso.
Documentacion API — MVP synthmulti
Contrato publico de la libreria: schema, generator, diagnosticos e invariantes.
Dataset demo — perfiles mixtos
CSV de demostracion con variables continuas, binarias, ordinales y categoricas.
Dataset demo — Iris
Dataset clasico Fisher Iris para pruebas rapidas del pipeline.
Limites de uso
Compromiso con el rigor
- Transparencia: cada informe documenta parametros, semilla y metodo de dependencia.
- Trazabilidad: metadata JSON con version del generador y hash del esquema.
- No sustitucion: los datos sinteticos apoyan el analisis; no reemplazan el juicio experto.
- Los datasets generados son demostrativos. No constituyen asesoramiento legal, clinico ni regulatorio.