// proyectos / 2025-2026

Entrenamiento distribuido en Kubernetes

Este proyecto está exactamente donde se cruzan mis dos mundos: machine learning e infraestructura cloud-native. Muestra entrenamiento distribuido de modelos con ParameterServerStrategy de TensorFlow corriendo en un clúster de Kubernetes.

Problema

Entrenar un modelo en una sola máquina es una celda de notebook; entrenarlo en un clúster es un problema de infraestructura: asignación de roles, descubrimiento de servicios, redes y aislamiento de fallos. Este proyecto recorre ese problema en su forma mínima y legible.

Arquitectura

Qué demuestra

Que el entrenamiento distribuido es, fundamentalmente, un problema de diseño de infraestructura de clúster (asignación de roles, descubrimiento de servicios, redes y aislamiento de fallos), y no solo uno de machine learning.