Saltar al contenido
Qué guardamos y qué compartimos

Qué guardamos y qué compartimos

Teramot construye y opera el data warehouse de cada proyecto. Para eso guarda una copia de las tablas que el cliente elige incorporar, en infraestructura propia de Teramot en AWS. Esta página reúne en un solo lugar qué información se guarda, qué información sale de esa infraestructura, hacia quién y por cuánto tiempo.

Resumen

    flowchart LR
    S[(Sistemas del cliente)] -->|Solo lectura| X
    subgraph AWS["Teramot en AWS us-east-1"]
        X[Extractores] --> L[(Data lake<br/>cifrado AES-256)]
        L --> Q[Motor SQL]
        C[(Base de configuración<br/>cifrada AES-256)]
    end
    Q -->|Esquemas, estadísticas<br/>y muestras| M[Proveedores de modelos<br/>Anthropic, OpenAI]
    Q -->|Trazas de los agentes| T[Observabilidad de IA<br/>LangSmith, Langfuse]
    X -->|Metadatos de ejecución| O[Orquestación<br/>Temporal Cloud]
  
  • Las tablas completas quedan dentro de la infraestructura de Teramot en AWS.
  • A los proveedores de modelos solo llegan esquemas, estadísticas y muestras acotadas, nunca tablas completas.
  • Nada se usa para entrenar modelos.

Qué guardamos

InformaciónDóndeRetención
Datos crudos, procesados y tablas de resultadosData lake en Amazon S3, formato Apache IcebergMientras exista la fuente o el proyecto
Versiones anteriores de cada tabla (snapshots)Data lake en Amazon S33 días
Archivos que sube el usuarioAmazon S3Mientras exista la fuente
Esquemas de las tablasAWS Glue Data Catalog, una base por proyectoMientras exista la tabla
Configuración: workspaces, proyectos, miembros, fuentes, consultas de limpieza y de resultados, dashboardsAmazon Aurora PostgreSQLMientras exista el objeto; copias de seguridad por 7 días
Credenciales de los sistemas de origenAmazon Aurora PostgreSQLMientras exista la fuente
Logs técnicosAmazon CloudWatch365 días

Cifrado en reposo

  • Los archivos del data lake, los archivos subidos y los resultados de consultas se guardan en Amazon S3 con cifrado AES-256 del lado del servidor, activo por defecto en todos los buckets. Ningún bucket tiene acceso público.
  • Las bases Amazon Aurora PostgreSQL tienen el almacenamiento cifrado con AWS KMS, lo que incluye sus copias de seguridad y snapshots.
  • Las credenciales de los sistemas de origen se guardan en esa base cifrada y la API nunca las devuelve.
  • Las claves de cifrado las administra AWS. Hoy no se ofrecen claves provistas por el cliente (BYOK).

El cifrado en tránsito se describe en Seguridad y control de acceso.

Qué compartimos y con quién

Estos son los servicios externos que reciben información derivada de los datos del cliente durante el procesamiento:

DestinatarioPara quéQué recibeRetención
Anthropic y OpenAIModelos de lenguaje de los agentes de datosEsquemas, estadísticas por columna y muestras acotadas de valores (ver el detalle abajo)Según las condiciones de API del proveedor, que excluyen ese tráfico del entrenamiento
LangSmith y LangfuseTrazas de los agentes, para depurar y mejorar su calidadLo que entra y sale de cada llamada al modelo, incluidas las muestras14 días
Temporal CloudOrquestación de las ejecucionesMetadatos de ejecución: nombres de tablas, esquemas, consultas y estado de cada pasoDurante la ejecución y un período corto posterior
SentryMonitoreo de erroresInformación técnica de erroresPeríodo limitado

La lista completa de proveedores, incluidos los de identidad, facturación y analítica de la aplicación, está en Proveedores que procesan datos.

Qué recibe cada agente de datos

AgenteQué recibe¿Incluye valores reales?
Limpieza de datosEsquema, estadísticas por columna, claves declaradas y una muestra de hasta 100 filasSí, la muestra
Tablas de resultadosPedido del usuario, catálogo y esquemas de las tablas, conocimiento del proyecto, los valores más frecuentes de cada columna y las primeras filas de las consultas que pruebaSí, valores frecuentes y filas de prueba
Reconciliación de tiposEsquemas y estadísticas de las columnas que se cruzanNo
DocumentaciónEsquemas, descripciones de columnas y consultas de limpiezaNo

Las muestras se envían sin enmascarar, porque el agente necesita ver valores reales para limpiar bien. Ver Cómo limitar lo que se comparte.

Qué no hacemos

  • No entrenamos modelos propios ni hacemos fine-tuning con datos de clientes.
  • No vendemos ni compartimos datos de clientes con otros clientes ni con terceros fuera de los listados en esta página.
  • No escribimos en los sistemas de origen: solo leemos.
  • No replicamos datos a otras regiones de AWS.
  • No guardamos el historial del origen: se conserva la versión actual de cada tabla y 3 días de versiones anteriores.

Cómo limitar lo que se comparte

  • Elegir qué tablas incorporar. Solo se procesan las tablas que el cliente selecciona al configurar la fuente.
  • Excluir columnas en el origen. Si una tabla tiene datos personales o sensibles que no hacen falta para el análisis, lo recomendable es exponer una vista sin esas columnas y conectar la vista.
  • Usar un usuario de solo lectura con permisos limitados a las tablas que se van a incorporar.
  • Borrar lo que ya no se necesita. Al eliminar una fuente o un proyecto se borran sus tablas y archivos. Ver Retención y borrado.