Ver temas

Última actualización: 15 · 11 · 2016

¿Hasta dónde se puede llegar en el Data Science sin estadística?

The Signal and the Noise; Why So Many Predictions Fail but Some Don’t es un influyente libro de Nate Silver, que alcanzó la fama por sus predicciones de las elecciones presidenciales de EE.UU. Los datos no son otra cosa: una combinación de señal y de ruido, de categoría y de anécdota, de grano y paja. […]

The Signal and the Noise; Why So Many Predictions Fail but Some Don’t es un influyente libro de Nate Silver, que alcanzó la fama por sus predicciones de las elecciones presidenciales de EE.UU. Los datos no son otra cosa: una combinación de señal y de ruido, de categoría y de anécdota, de grano y paja.

 

La tarea del científico de datos ahora, igual que la del estadístico desde hace más de un siglo, consiste en separar la una del otro, extraer los patrones repetibles y repetidos sin dejarse engañar por los aleatorios. La estadística, la ciencia de datos, se reducen a eso. Cuando no lo consiga, sus predicciones fallarán.

 

Ciencia de datos es lo que hace un estadístico que programa, que sabe enfrentarse solventemente los conjuntos de datos a los que nos tiene acostumbrados el siglo XXI. O lo que hace un programador que aprendió la estadística necesaria para ver el bosque y no solo los árboles.

 

Hace unos pocos días, tenía un conversación por correo electrónico con un un científico de datos, exalumno del Máster de Data Science de KSchool, que quería profundizar en los detalles de un algoritmo muy usado en márketing analítico: el del multi armed bandit. Es el algoritmo que, precisamente, subyace a uno de los productos de Google Analytics. Por supuesto que está soportado por la increíble infraestructura de datos de Google. Pero utiliza ideas que se conocen y usan en el mundo de la estadística desde hace dos siglos: la estadística bayesiana.

 

Las herramientas de Google para medir el impacto causal de, por ejemplo, campañas publicitarias, también está basado en un desarrollo de la misma teoría. ¿Hace falta conocerla para usar esas herramientas? No. Pero sí para adaptarlas a un contexto similar pero no exactamente igual. Aunque, por supuesto, también necesitaremos saber programarlas.

 

¿Hasta dónde se puede llegar sin estadística en la ciencia de datos? Desgraciadamente, no muy lejos. Los recetarios de técnicas de machine learning incluyen muchos programas y trucos que permiten, incluso, llegar a obtener algún éxito parcial en plataformas como Kaggle. Pero un paseo por sus foros, una discusión con algunos de quienes participan en ellas, revela que muchos se limitan a dar tumbos sin criterio, sin una idea clara de qué quieren conseguir y, muy particularmente, cómo. Revela crueldad, pero cuando pienso en ellos siempre me vienen a la cabeza estas dos palabras: script kiddie.

 

La teoría, la estadística en este caso, no es nunca un corsé que aprieta sino una guía que orienta. Las herramientas de ciencia de datos, muchas y poderosas, que uno puede encontrar implementadas en Python, R o Spark son genéricas. Valen para todo pero, en el fondo, para nada. Cuando las enseño en KSchool, lo reconozco aquí, me cuesta encontrar conjuntos de datos de ejemplo en los que poder aplicarlas tal cual, sin ningún tipo de adaptación específica al caso concreto. Pero después, en la vida real, el valor reside en la capacidad de lidiar con esos impedimentos concretos y específicos del problema en cuestión. Es, como abría el párrafo, la teoría la que orienta.

modulos_previos_datascience_17

El programa del máster de Data Science de KSchool dedica algunas sesiones a profundizar en en la estadística. Son, por necesidad, pocas. Pero están pensadas (como, de hecho, gran parte del programa) como una base sobre la que construir y ahondar. Ponen al científico de datos en el camino del proceso de aprendizaje constante.

Si no tienes esta base, desde la propia escuela, se ha preparado un programa previo de estadística para que el alumno pueda aprender toda la base necesaria para poder seguir el ritmo del Máster y aprovecharlo al máximo.

 

Hoy mismo he visto que el exalumno al que me refería más arriba publicaba en su Twitter una foto de su nueva adquisición: un libro de estadística bayesiana para hackers. Seguro que lo hace mejor programador, mejor estadístico y, necesariamente, mejor científico de datos.

 

Carlos Gil Bellosta

El artículo ¿Hasta dónde se puede llegar en el Data Science sin estadística? fue escrito el 15 de noviembre de 2016 y guardado bajo la categoría Data Science. Puedes encontrar el post en el que hablamos sobre bajo las siguientes etiquetas escuela big data science, kschool, master de data science.

Noticias analítica web

09 · 03 · 2023

4 libros de profesores de KSchool para regalar o regalarte esta Navidad

¿No sabes qué regalar estas navidades? Echa un vistazo a las sugerencias que te hacemos a continuación para acertar con los libros de los profesores de KSchool. Un regalo que te ayudará a mejorar tu formación de una manera muy entretenida. Libros de profesores de Kschool A continuación te mostramos 4 libros imprescindibles para mejorar […]

Noticias Data Science

03 · 03 · 2023

Beneficios de estudiar Data Science

Los datos son uno de los valores más importantes para las empresas, pero debido a la gran cantidad de ellos que podemos encontrar en la red, es complicado poder gestionarlos correctamente para obtener una información valiosa y necesaria que ayude a mejorar la toma de decisiones en cualquier empresa. Debido a esto, cada vez más […]

Noticias Data Science

03 · 03 · 2023

Razones para aprender a programar en Python

En los últimos años se ha convertido en uno de los lenguajes de programación favorito de los profesionales por su versatilidad, por lo que aprender a programar en Python es una gran opción para cualquier programador. Si aún no lo conoces te contamos por qué motivos deberías formarte en este lenguaje y cómo puede ayudarte […]

Noticias Data Science

03 · 03 · 2023

¿Por qué los Data Scientists usan la programación en Python?

¿Te has preguntado alguna vez por qué los Data Scientist prefieren utilizar la programación en Python frente a otros lenguajes? Te contamos qué ventajas tiene para estos profesionales y por qué motivo se ha convertido en su preferido a la hora de poder realizar su trabajo. Entre las funciones de los Data Scientists está la […]

Solicita información

    Información sin compromiso

    Acepto que un asesor me contacte por Whatsapp
    Recibir información de KSchool, así como del resto de empresas del Grupo Proeduca, vinculadas al sector de la educación.

      Por cierto...

      Selecciona las opciones que prefieres para comunicarnos contigo.

      Acepto que un asesor me contacte por Whatsapp
      Recibir información de KSchool, así como del resto de empresas del Grupo Proeduca, vinculadas al sector de la educación.

      Gracias

      Nos pondremos en
      contacto contigo lo antes
      posible.

      En cualquier caso, si tienes
      alguna pregunta o duda, puedes
      llamarnos al:

      917 873 991

      Lunes a jueves de 9:00 a 18:00 y viernes de
      9:00 a 14:00

      Terminar

      Llama ahora

      y un asesor te informará sin
      compromiso

      o si lo prefieres

      ¿Te llamamos?

        Información sin compromiso

        Acepto que un asesor me contacte por Whatsapp
        Recibir información de KSchool, así como del resto de empresas del Grupo Proeduca, vinculadas al sector de la educación.