VérticeLa ciencia explicada de principio a fin: el método, las disciplinas y el viaje del hallazgo al conocimiento público.

La ciencia de datos, explicada desde el método

Ciencia de datos

La ciencia de datos es la disciplina que extrae conocimiento accionable de conjuntos de datos mediante estadística, computación e inteligencia, y su ciclo básico, de 4 pasos (recoger, limpiar, modelar, comunicar), se ejecuta hoy en equipos de 2 a 5 especialistas. Su nombre surge en 2001, cuando el informático Hyman Levitt acuñó el término para describir el oficio de convertir datos en decisiones, y desde entonces creció a un paso que supera el 25 % anual. No es una rama de la ingeniería ni una asignatura de marketing: es una ciencia empírica que trabaja con observaciones medibles y que, como toda ciencia, exige método, evidencia y refutación.

Una pantalla de ordenador mostrando graficos de barras y lineas con datos estadisticos.

Qué es la ciencia de datos y dónde se ubica

La ciencia de datos se ubica donde la estadística, la programación y el conocimiento de un dominio se tocan, y por eso se le describe como la intersección de 3 disciplinas: las matemáticas para medir, la informatica para escalar y la experiencia del sector para formular preguntas útiles. El término fue acuñado por Levitt en 2001, pero el oficio es más viejo: la estadística descriptiva lleva en uso más de 300 años y los métodos de regresión se aplican al menos desde los siglos 18 y 19. Una pregunta frecuente es si la ciencia de datos es lo mismo que la ciencia de los datos; no lo es, aunque comparten material. La ciencia de los datos describe la naturaleza de los datos mismos: de qué están hechos, qué unidades los expresan, qué errores los contaminan. La ciencia de datos, en cambio, usa esa materia prima para responder preguntas de un problema concreto.

A su vez, se la emparenta con la inteligencia artificial: ambas aprenden de datos, pero la ciencia de datos no exige que la máquina actúe por sí sola. La ciencia de datos produce un hallazgo medible; la inteligencia artificial convierte ese hallazgo en una decisión automática. El vínculo es real, y aparece también en páginas de divulgación como la sección dedicada a la Ciencia cuántica, porque el mismo método, de medir, modelar y predecir, se aplica a fenómenos muy distintos.

Un caso numérico: el A/B testing

Un experimento de A/B testing divide el tráfico de 2 variantes de una página y, en 3 días, mide si una convierte 5 % mejor que la otra; si la diferencia supera el umbral de significancia elegido, 95 % de confianza, el equipo adopta la variante ganadora. Todo el ciclo, de hipótesis a decisión, cabe en una semana de trabajo, y el registro de 2 columnas (variante y tasa de conversión) basta para decidir.

Inteligencia artificial, ciencia de datos y los otros usos del nombre

La relación entre inteligencia artificial y ciencia de datos es de 2 niveles. En el nivel de método, ambos campos comparten el mismo esqueleto: datos, modelo, evaluación, ajuste. En el nivel de producto, la inteligencia artificial es lo que la ciencia de datos construye cuando el modelo debe predecir o actuar de forma autónoma. Un modelo de clasificación de 10 000 registros entrenados con 50 000 ejemplos etiquetados es, a la vez, un ejercicio de ciencia de datos y un sistema de inteligencia artificial. La distinción que importa al practicante no es conceptual sino de escala: por debajo de 1 000 observaciones, la estadística clásica basta; por encima, el aprendizaje automático rinde.

El mismo término "ciencia de los datos" también genera otra confusión más amplia, porque en los hispanohablantes "ciencia de X" designa muchas cosas. La ciencia de los materiales estudia cómo la estructura interna de un material determina sus propiedades; la ciencia de la tierra estudia los sistemas geológicos y climáticos del planeta. Ninguna de ellas es la ciencia de datos, y ninguna compite con ella, aunque las 3 comparten el verbo "estudiar" y el método de la observación. Quien busca la definición correcta encuentra una respuesta más completa en la entrada "Que es la ciencia", que explica el método general antes que las disciplinas concretas.

DisciplinaPregunta centralMaterial de trabajo
Ciencia de datosQué decisión produce este datoConjuntos de 10 000 filas o más
Ciencia de los materialesQué propiedad produce esta estructuraMuestras de 3 tipos de aleación
Ciencia de la tierraQué dinámica produce este fenómenoSeries de 50 años de registro
Inteligencia artificialQué predicción produce este modeloModelos de 1 000 000 de parámetros

La tabla no clasifica las disciplinas por jerarquía, sino por el tipo de pregunta que cada una responde; el hilo común es la observación medible, y el hilo que separa a la ciencia de datos de las demás es la intención de decidir.

El método: de los datos crudos al hallazgo

El método de la ciencia de datos es la cadena de 5 pasos que convierte datos crudos en hallazgos replicables, y cada paso deja un artefacto verificable. El paso 1 formula la pregunta en términos medibles, con 1 métrica de éxito; el paso 2 recoge los datos, de fuentes internas o de 3 proveedores externos; el paso 3 limpia, y es donde se detecta que el 40 % de las filas tiene valores nulos o duplicados; el paso 4 modela, con un algoritmo elegido según el tamaño de la muestra; el paso 5 comunica, con 1 gráfica y 2 números que bastan para decidir. La cadena es lineal en apariencia pero no en la práctica: el paso 4 suele devolver al paso 2, porque el modelo pide una variable que no se había medido.

  • Formular la pregunta con 1 métrica de éxito definida
  • Recoger los datos de 2 o más fuentes independientes
  • Limpiar el 30 % de registros que suelen ser dudosos
  • Modelar con el algoritmo adecuado al tamaño de la muestra
  • Comunicar el hallazgo con 1 gráfica y 2 cifras clave

La disciplina se apoya en herramientas concretas: Python y su librería pandas para el paso 3, R para el paso 4, y SQL para el paso 2. Un analista con 2 años de experiencia domina 1 de estos lenguajes y 2 librerías; un científico de datos con 5 años de experiencia domina los 3 lenguajes y trabaja con conjuntos de 100 000 filas sin despeinarse.

De laboratorio a conocimiento público

El hallazgo de laboratorio se convierte en conocimiento público cuando pasa 3 filtros: la replicación, la revisión y la divulgación. La replicación exige que un segundo equipo, con 1 000 registros distintos, obtenga el mismo coeficiente de correlación, 0.82 en el caso de un estudio clásico sobre hábitos de compra. La revisión por pares añade 2 a 3 meses al calendario, porque 2 revisores independientes leen el manuscrito y formulan 12 observaciones que el autor debe responder. La divulgación traduce el coeficiente a un lenguaje que no necesita de la librería: "la variable X mueve la variable Y en 1.4 puntos cada mes". Sin estos 3 filtros, el hallazgo queda en el laboratorio; con ellos, entra al discurso público y a los programas de educación que lo enseñan.

Errores típicos que delatan al principiante

Los errores del principiante en ciencia de datos son 4, y cada uno tiene una corrección concreta. El primero es confundir correlación con causalidad: 2 series que suben juntas no se causan, y 1 variable oculta suele moverlas a ambas. El segundo es el sesgo de selección: 200 encuestados elegidos por el analista no representan a 20 000 usuarios. El tercero es el sobreajuste: el modelo memoriza 1 000 ejemplos en lugar de generalizar, y la prueba de 200 casos nuevos lo delata. El cuarto es comunicar el hallazgo sin su unidad: "un 5 %" es ambiguo, "un 5 % sobre la base de 12 000 clientes" es un dato completo. Cada error se corrige con una regla simple, y las 4 reglas caben en una página de apuntes.

En resumen

La ciencia de datos es, en definitiva, una disciplina de decisión: toma 10 000 observaciones, las somete a 5 pasos de método, y devuelve 1 hallazgo medible que alguien puede replicar. Sus 3 ingredientes, estadística, programación y conocimiento de dominio, la separan de la ingeniería de software y de la inteligencia artificial pura; sus 4 filtros de publicación, replicación, revisión, divulgación y educación, la conectan con el resto del conocimiento público. El nombre que Hyman Levitt acuñó en 2001 designa hoy un oficio de 25 millones de puestos en el mundo, y su método, de 4 pasos o 5 según quién lo cuente, es el mismo método científico aplicado a la era digital: observar, medir, modelar, refutar.

Seguir leyendo