""

sábado, 7 de febrero de 2026

Python For Data Science. Protección de datos

 Fuente: Google & Coursera

Proteger a las personas que están detrás de los datos
Estado: Traducido automáticamente del Inglés

Información:
Este elemento incluye contenido que aún no se tradujo a tu idioma preferido.

A todos nos ha pasado...

Ya sea en el trabajo o en la escuela, llega un momento en el que te das cuenta de que has cometido un error en una redacción o en un proyecto en el que has estado trabajando y hay que corregirlo.

"Pero piensa en todos los problemas que eso causará", piensas. "El proyecto se retrasará y todo el mundo se enterará de que he cometido un error".

¿Realmente merece la pena invertir tiempo y esfuerzo en detener el proceso y arreglarlo?

Para los profesionales de los datos, la respuesta tiene que ser siempre .

La visión de conjunto

Incluso los profesionales de datos experimentados pueden no ver el panorama general. Por muy intuitivos que puedan ser nuestros cerebros, a menudo no vemos cómo un pequeño error, un cambio minúsculo o una elección aparentemente insignificante sobre el análisis de datos pueden tener implicaciones significativas en un proceso, una empresa o incluso toda una población.

Para ilustrarlo, imaginemos una cuadrícula en la que se alternan círculos naranjas y azules. Ahora imagine que hay una persona que sólo puede ver una pequeña parte de los seis círculos. ¿Y si esta persona decide que tiene más sentido que los círculos estén ordenados por grupos, con los círculos naranjas arriba y los azules abajo? Se dará cuenta de que, aunque los círculos del rectángulo se perciban como ordenados, la realidad es que el cambio ha alterado el patrón general. Ahora imagine que el rectángulo de seis círculos es un departamento y la cuadrícula más grande es una empresa entera.

Una cuadrícula de 9 x 4 círculos azules y naranjas, dispuestos en un patrón alterno, excepto una sección bloqueada.

Una mentalidad ética

Esperamos que esta ilustración le ayude a comprender la importancia del contexto y el alcance cuando se manejan datos. Un principio que puede ayudar a los profesionales de datos a mantener los datos en su contexto es la ética y el desarrollo de una mentalidad ética.

He aquí tres conceptos importantes que le ayudarán a fomentar una mentalidad ética cuando intente contar historias con los datos:

  • Los modelos tienen vida más allá de los bloques de código y las cadenas de datos.

  • Ciencia de datos necesita cumplimiento normativo.

  • Los clientes deben elegir cómo se utilizan sus datos.

Los modelos tienen vida más allá de los bloques de código y las cadenas de datos

Puede haber una tendencia a pensar que los datos son estrictamente números y matemáticas. La realidad es que los datos consisten en entradas impulsadas por personas. Los profesionales de los datos nunca deben perder de vista que el análisis en todas sus formas (visualizaciones, modelos, decisiones y estrategias) afecta a las personas.

El objetivo final de todo trabajo de análisis de datos y Ciencia de datos debe ser mejorar la vida de las personas y los grupos. La próxima vez que diseñe un panel de datos o codifique un algoritmo complejo, tómese un momento para pensar en el impacto que los datos pueden tener en los seres humanos y si las decisiones que toma alteran ese impacto para mejor. Recuerda que tus propios prejuicios pueden impedirte anticipar muchas de las repercusiones, por lo que recabar la opinión de un grupo diverso de miembros del equipo te ayudará a mitigar tus prejuicios personales.

Profesional de los datos que mira los datos, detrás de los cuales hay grupos de personas que viven la vida.

He aquí un ejemplo hipotético de la carrera de datos para ayudarte a ver cómo este concepto puede repercutir algún día en tu trabajo:

  • Imagina que un profesional de los datos está analizando datos sobre el flujo de tráfico para ayudar a un urbanista de una gran área metropolitana a decidir dónde debe centrarse la ampliación de las carreteras. A primera vista, el uso de datos para la construcción de carreteras parece una decisión puramente financiera entre una ciudad y una empresa constructora de carreteras. El análisis del profesional le llevó primero a seleccionar un terreno más accidentado y accidentado como el lugar más rentable para la ampliación de carreteras. Pero tras analizar los datos con preocupación por los ciudadanos y las familias que conducirán por esas carreteras en todas las estaciones, el análisis del profesional de los datos determinó que la zona montañosa tenía un mayor riesgo de accidentes, y decidió recomendar un lugar más llano para la ampliación de la carretera.

La Ciencia de datos necesita cumplir la normativa

Si no estás familiarizado con las leyes y normativas del sector en el que trabajas, tu trabajo no sólo será mucho más difícil, sino que también podrías meterte en problemas legales. Un profesional de los datos debe estar siempre al día y cumplir todas las normativas de su campo concreto. A modo de ejemplo, cuando empieces un nuevo trabajo en el ámbito profesional de los datos, puedes hacer lo siguiente:

  • Pide a tu jefe que te oriente sobre el cumplimiento de la normativa.

  • Dedique tiempo a investigar las políticas de Gobierno de datos.

  • Tómate tiempo para investigar el organismo regulador de tu sector concreto y sus documentos de política pertinentes.

Ten en cuenta que el campo del Gobierno de datos es bastante joven y que las normativas pueden cambiar y cambiarán a un ritmo rápido. Asegúrese de estar al día de los cambios.

Es importante cumplir las normas... pero no sólo por cumplirlas. Estas son algunas de las ventajas importantes de cumplir las normas de los organismos reguladores y las políticas de Gobierno de datos:

  • Mantiene los datos de los clientes y de la empresa a salvo de las amenazas a la seguridad

  • Refuerza la confianza de los clientes, los grupos de pares, las empresas y el público en general

  • Reduce la probabilidad de pérdida o mala gestión de los datos

  • Garantiza que los datos críticos para la empresa sigan siendo utilizables, accesibles y disponibles

Los clientes deben elegir cómo se utilizan sus datos

Cada día que pasa, la tecnología es más avanzada y capaz. A medida que los datos se involucran cada vez más en nuestra vida cotidiana, es lógico que los propios datos sean cada vez más importantes y valiosos. Por ello, la privacidad y la seguridad de los datos son fundamentales para los clientes de una empresa y los ciudadanos de un gobierno.

Como profesionales de los datos, es nuestra responsabilidad ética tratar los datos de clientes y consumidores con respeto y dignidad. Las empresas que almacenan, analizan y utilizan datos como parte de sus procesos empresariales deben asegurarse de que dichos procesos sean transparentes y conformes. Los clientes que divulgan información confidencial para obtener un servicio deben poder confiar en que los datos seguirán siendo confidenciales y no se verán comprometidos por infracciones o amenazas a la ciberseguridad.

Descubrirá que muchas empresas han empezado a tratar los datos de los clientes con más cuidado y seguridad internos. Cada vez son más las empresas que imparten una amplia formación a sus empleados sobre el tratamiento y la seguridad de los datos de los clientes. Muchas están añadiendo sistemas de autenticación de múltiples factores y auditando a sus proveedores externos, lo que exige altos niveles de sistemas y plataformas de seguridad digital.

Como ejemplo, debido a que las violaciones de datos como Home Depot en 2014, Uber en 2017 e Instagram en 2020 han sido comunes durante décadas, las corporaciones están aumentando cada vez más la ciberseguridad, la capacitación de empleados y proveedores, y la transparencia hacia los clientes y el público con respecto a los métodos de recopilación y uso de datos. En concreto, Home Depot ha incluido la seguridad de los datos en su plan de gestión de riesgos y ha creado una página web sobre seguridad de los datos que describe qué datos recopilan y cómo los utilizan.

La transparencia de los datos no sólo es buena para las empresas, sino que es lo correcto, lo ético. Los profesionales de los datos deben entenderlo mejor que nadie.

Puntos clave

Ética de los datos es un campo en expansión y sigue siendo una parte integral del trabajo diario de un profesional de los datos. Cuando manipule, analice o utilice datos de cualquier tipo, recuerde que los modelos de datos tienen vida más allá de los bloques de código y las cadenas de datos. Ciencia de datos necesita el cumplimiento de la normativa y los clientes siempre deben poder elegir cómo se utilizan sus datos.

Recursos para obtener más información

El Gobierno de datos y la Ética de los datos son un campo de trabajo y estudio cada vez más amplio. Aquí tiene algunos recursos por si desea saber más:

miércoles, 4 de febrero de 2026

Python For Data Science. Reduplicación de datos

 

Deduplicación de datos con Python
Estado: Traducido automáticamente del Inglés

Información:
Este elemento incluye contenido que aún no se tradujo a tu idioma preferido.

En esta lectura, aprenderá más sobre la gestión de duplicados. También aprenderá a identificar y decidir si la deduplicación es la estrategia adecuada para un conjunto de datos. Además, aprenderás algunas funciones comunes de Python para manejar duplicados.

Identificación de duplicados

Antes de tomar una decisión sobre si eliminar o no los valores duplicados, debemos determinar si existen valores duplicados en nuestro conjunto de datos.

Una forma sencilla de identificar duplicados es utilizar la función duplicated() de Pandas. duplicated() es un método de la clase DataFrame.

Esta función devuelve una serie de resultados "verdadero/falso", con "verdadero" indicando que el valor de los datos es un duplicado, y "falso" indicando que es un valor único.

He aquí un ejemplo de un marco de datos de cinco filas:

>>import pandas as pd >>df = pd.DataFrame([['wowyow','cistern',4.0],['wowyow','cistern',4.0],['Splaysh','jug', 5.5],['Splaysh', 'stock',3.3], ['Pipplee','stock',3.0]], columns=['brand', 'style', 'rating']) >>>df

brandstylerating
0wowyowcistern4.0
1wowyowcistern4.0
2Splayshjug5.5
3Splayshstock3.3
4Pippleestock3.0

Utilizando la función duplicated(), el resultado es que una ha sido marcada como "True", indicando que es un duplicado.

>>print(df)
>>print()
>>print(df.duplicated())

brand style rating 0 Wowyow cistern 4.0 1 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0 0 False 1 True 2 False 3 False 4 False dtype: bool

La identificación de duplicados para todo un marco de datos será diferente a la de una sola columna o índice. Asegúrese de utilizar la función duplicated() para un marco de datos completo. La función duplicated() sólo devolverá filas enteras que tengan valores que coincidan exactamente, no sólo valores individuales que coincidan encontrados dentro de una columna. Si desea identificar duplicados sólo para una columna o una serie de columnas dentro de un marco de datos, deberá incluirlo en la parte "subconjunto" del campo de argumento de la función duplicated(). Además, si desea especificar cuál de los duplicados debe mantenerse como "original" en lugar de como duplicado, puede especificarlo en la parte keep del campo de argumentos.

A continuación se muestra un ejemplo de identificación de duplicados en una sola columna (subconjunto) de valores y etiquetado de los últimos duplicados como "falso", de modo que se "mantienen":

>>print(df)
>>print()
>>print(df.duplicated(subset=['type'], keep='last'))

>>>

color rating type 0 olive 9.0 rinds 1 olive 9.0 rinds 2 gray 4.5 pellets 3 salmon 11.0 pellets 4 salmon 7.0 pellets 0 True 1 False 2 True 3 True 4 False dtype: bool

Hora de decidir: ¿Suprimir o no suprimir ?

COMO YA HA APRENDIDO, cada conjunto de datos es único y no se puede tratar a todos por igual. A la hora de tomar la decisión de eliminar o no los valores duplicados, piense detenidamente en el propio conjunto de datos y en el objetivo que desea alcanzar. ¿Qué impacto tendrá la eliminación de duplicados en su conjunto de datos y en su objetivo?

1. Decidir eliminar

Debe eliminar los valores duplicados si éstos son claramente erróneos o no representan correctamente el resto de valores únicos del conjunto de datos.

Esta imagen muestra una tabla de datos con los precios de la vivienda. Dos filas contienen los mismos datos.

Por ejemplo, puede estar razonablemente seguro de que un profesional de los datos eliminará (en la mayoría de los casos) los valores duplicados de un conjunto de datos que contenga direcciones y precios de viviendas. Contar la misma casa dos veces (en la mayoría de los casos) falseará cualquier conclusión extraída del conjunto de datos en su conjunto, como el precio medio de la casa, el precio total de la casa o incluso el número total de casas. En un caso como éste, un profesional de los datos eliminaría casi con toda seguridad los datos duplicados para representar de forma equitativa los datos restantes durante el análisis y la visualización.

2. Decidir NO eliminar

Debe mantener los datos duplicados en su conjunto de datos si es evidente que los valores duplicados no son errores y deben tenerse en cuenta a la hora de representar el conjunto de datos en su conjunto.

Esta imagen muestra una tabla de datos con datos de lanzamiento de peso olímpico. Dos conjuntos de filas contienen los mismos datos.

Por ejemplo, un conjunto de datos que marque el número de lanzamientos y distancias de un atleta olímpico de lanzamiento de peso en entrenamiento incluirá probablemente varias distancias duplicadas; sólo por la naturaleza del número de intentos y los límites que una persona puede tener una bola lastrada, habrá valores duplicados, especialmente si las medidas de distancia están etiquetadas con sólo 1 ó 2 decimales. En un caso así, es casi seguro que un profesional de los datos conservaría todos los datos para representarlos equitativamente en su conjunto durante el análisis y la visualización.

No se deje engañar - Cómo hacer la deduplicación

Antes de volver a Python y aprender a eliminar duplicados, definamos el término "deduplicación":

  • Deduplicación: La eliminación o remoción de valores de datos coincidentes en un conjunto de datos.

Existen varias bibliotecas, funciones y métodos en Python que se pueden utilizar para eliminar valores de datos coincidentes.

Una de las funciones más comunes es Pandas: drop_duplicates()

drop_duplicates() es otro método de DataFrame. Se utiliza para crear un nuevo marco de datos con todas las filas duplicadas eliminadas.

Por ejemplo, utilice un marco de datos de antes en esta lectura:

>>df

>>>

brand style rating 0 Wowyow cistern 4.0 1 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0

Ahora aplique la función eliminar duplicados:

>>df.drop_duplicates()

>>>

brand style rating 0 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0

Notará en la salida resultante que la fila duplicada de datos fue eliminada, dejando intactos los valores únicos restantes.

Nota: Tenga en cuenta que la función drop_duplicates(), tal como se ha escrito anteriormente, sólo eliminará los duplicados de coincidencias exactas de filas de datos completas. Si desea eliminar duplicados dentro de una única columna, deberá especificar qué columnas desea comprobar en busca de duplicados utilizando el argumento de la palabra clave subset.

Este ejemplo elimina todas las filas que tienen valores duplicados en la columna style (excepto la primera):

>>print(df)

>>df = df.drop_duplicates(subset='style')
>>print()
>>print(df)

>>>

brand style rating 0 Wowyow cistern 4.0 1 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0

Este ejemplo elimina todas las filas (excepto la primera) que tienen valores duplicados en las columnas style y rating:

>>print(df)

>>df = df.drop_duplicates(subset=['style''rating'])

>>print()
>>print(df)

>>>

brand style rating 0 Wowyow cistern 4.0 1 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0 brand style rating 0 Wowyow cistern 4.0 2 Splaysh jug 5.5 3 Splaysh stock 3.3 4 Pipplee stock 3.0


Puntos clave

La identificación de valores de datos duplicados en un conjunto de datos es una parte importante de las prácticas de EDA (o "Análisis exploratorio de datos"), en concreto de la limpieza y la validación. Una vez identificados los duplicados, piense en el impacto que tendrá en el conjunto de datos y en el objetivo de su análisis cuando decida eliminar o no los duplicados.

Recursos adicionales

¿Desea obtener más información sobre los duplicados y la deduplicación? Consulte los siguientes enlaces adicionales.

domingo, 1 de febrero de 2026

W3Schools. clase 2 Python

 

Ejecutar sintaxis de Python

Como aprendimos en la página anterior, la sintaxis de Python se puede ejecutar escribiendo directamente en la línea de comandos:

>>> print("Hello, World!")
Hello, World!

O creando un archivo Python en el servidor, usando la extensión de archivo .py y ejecutándolo en la línea de comandos:

C:\Users\Your Name>python myfile.py

Sangría de Python

La sangría se refiere a los espacios al comienzo de una línea de código.

Donde en otros lenguajes de programación la sangría en el código es para facilitar la lectura Solo que la sangría en Python es muy importante.

Python utiliza sangría para indicar un bloque de código.

EjemploConsigue tu propio servidor Python

if 5 > 2:
  print("Five is greater than two!")

Python te dará un error si omites la sangría:

Ejemplo

Error de sintaxis:

if 5 > 2:
print("Five is greater than two!")

El número de espacios depende de ti como programador, el uso más común es cuatro, pero tiene ser al menos uno.

Ejemplo

if 5 > 2:
 print("Five is greater than two!"
if 5 > 2:
        print("Five is greater than two!"

Tienes que usar la misma cantidad de espacios en el mismo bloque de código, De lo contrario Python te dará un error:

Ejemplo

Error de sintaxis:

if 5 > 2:
 print("Five is greater than two!")
        print("Five is greater than two!")


Variables de Python

En Python, las variables se crean cuando le asignas un valor:

Ejemplo

Variables en Python:

x = 5
y = "Hello, World!"

Python no tiene ningún comando para declarar una variable.

Aprenderá más sobre las variables en el Variables de Python capítulo.


Comentarios

Python tiene capacidad de comentarios para fines de documentación en código.

Los comentarios comienzan con a #, y Python representará el resto de la línea como un comentario:

Ejemplo

Comentarios en Python:

#This is a comment.
print("Hello, World!")

Ejercicio?

Verdadero o falso: la sangría en Python es solo para legibilidad.



W3Schools. Introducción a Python

 

¿Qué es Python?

Python es un lenguaje de programación popular. Fue creado por Guido van Rossum, y lanzado en 1991.

Se utiliza para:

  • desarrollo web (del lado del servidor),
  • desarrollo de software,
  • matemáticas,
  • scripting del sistema.

¿Qué puede hacer Python?

  • Python se puede utilizar en un servidor para crear aplicaciones web.
  • Python se puede utilizar junto con software para crear flujos de trabajo.
  • Python puede conectarse a sistemas de bases de datos. También puede leer y modificar archivos.
  • Python se puede utilizar para manejar grandes cantidades de datos y realizar matemáticas complejas.
  • Python se puede utilizar para la creación rápida de prototipos o para el desarrollo de software listo para producción.

¿Por qué Python?

  • Python funciona en diferentes plataformas (Windows, Mac, Linux, Raspberry Pi, etc).
  • Python tiene una sintaxis simple similar al idioma inglés.
  • Python tiene una sintaxis que permite a los desarrolladores escribir programas con menos líneas que otros lenguajes de programación.
  • Python se ejecuta en un sistema intérprete, lo que significa que el código se puede ejecutar tan pronto como se escribe. Esto significa que la creación de prototipos puede ser muy rápida.
  • Python puede tratarse de forma procedimental, orientada a objetos o funcional.

Es bueno saberlo

  • La versión principal más reciente de Python es Python 3, que usaremos en este tutorial.
  • En este tutorial Python se escribirá en un editor de texto. Es posible escribir Python en un entorno de desarrollo integrado, como Thonny, Pycharm, Netbeans o Eclipse, que son particularmente útiles al administrar colecciones más grandes de archivos Python.

Sintaxis de Python en comparación con otros lenguajes de programación

  • Python fue diseñado para ser legible y tiene algunas similitudes con el idioma inglés con influencia de las matemáticas.
  • Python utiliza nuevas líneas para completar un comando, a diferencia de otros lenguajes de programación que a menudo utilizan punto y coma o paréntesis.
  • Python se basa en la sangría, utilizando espacios en blanco, para definir el alcance; como el alcance de bucles, funciones y clases. Otros lenguajes de programación suelen utilizar corchetes rizados para este propósito.
>>print("Hello, World!")
>>>
print("Hello, World!")

Ejercicio?

¿Cuál es la extensión de archivo correcta para los archivos Python?





Entradas recientes

Estructura secuencial. solución matemática vs programación

 **Ejemplo resuelto # 4:** Fuente: Capitulo 3 del libro "Lógica de programación de Efraín Oviedo" A la mamá de Juan le preguntan s...

Entradas Populares