El caso de uso de propensión de compra es ampliamente aplicable a muchos sectores, especialmente retail, finanzas, seguros y marketing. El reto real no es solo entrenar un modelo, sino llevarlo desde la preparación del dato hasta una ejecución útil dentro de campañas, automatizaciones y sistemas de relación con clientes.

En este artículo se recupera una arquitectura práctica basada en BigQuery ML y Kubeflow Pipelines, pensada para enseñar cómo pasar de un dataset analítico a una solución operativa que permita clasificar usuarios con probabilidad de compra y activar acciones posteriores.

Arquitectura de solución de inicio a fin

El flujo de trabajo se apoyaba en una secuencia clara de pasos:

  1. Identificar una fuente de datos histórica con sesiones y transacciones.
  2. Cargar y preparar el dataset en BigQuery.
  3. Construir un modelo de clasificación para estimar la propensión de compra.
  4. Lanzar predicciones por lotes o predicciones online según el caso de uso.
  5. Integrar el resultado con un CRM o sistema de activación.
  6. Recomendar productos, lanzar campañas y medir el impacto.
  7. Monitorizar y reentrenar el modelo cuando sea necesario.

La propuesta utilizaba como ejemplo el dataset de Google Analytics de Google Merchandise Store y mostraba cómo seleccionar atributos útiles, crear la etiqueta will_buy_on_return_visit y generar una primera línea base con regresión logística en BigQuery ML.

Preparación y modelado

La parte central del artículo consistía en mostrar que una solución de ML útil no empieza por el algoritmo, sino por la selección correcta de variables, el periodo de entrenamiento y la calidad del dato. Se trabajaba con atributos como rebotes, tiempo en sitio y comportamiento de visita para alimentar un modelo supervisado de clasificación.

Una vez construida la tabla de entrenamiento, el modelo se creaba en BigQuery ML y se evaluaba con métricas como ROC AUC. El planteamiento era deliberadamente pragmático: no prometer el mejor scoring posible, sino establecer una base reproducible y medible que pudiera mejorarse con feature engineering, ajustes de umbral y nuevas fuentes de datos.

Predicción batch y predicción online

El artículo diferenciaba dos escenarios:

  • Predicción batch para campañas offline o enriquecimiento de segmentos.
  • Predicción online para personalización en tiempo real, activación de cupones, recomendaciones o acciones disparadas desde una aplicación web.

La solución mostraba cómo exportar el modelo desde BigQuery, desplegarlo en Cloud AI Platform Prediction y consumirlo mediante una llamada REST. Ese paso era importante porque conectaba el trabajo analítico con la capa de activación comercial y no dejaba el modelo aislado en un notebook.

Automatización con Kubeflow Pipelines

Otro de los puntos fuertes del contenido era la automatización del ciclo de vida del modelo con Kubeflow Pipelines. El flujo proponía componentes para:

  • Preparar datos y buckets de almacenamiento.
  • Entrenar y evaluar el modelo.
  • Preparar datasets de prueba para batch prediction.
  • Exportar el modelo y métricas.
  • Desplegar revisiones del modelo.
  • Ejecutar predicción online sobre Cloud AI Platform.

El valor de este enfoque estaba en mostrar un puente claro entre analítica, MLOps y operación. No se trataba solo de entrenar un clasificador, sino de empaquetarlo dentro de un flujo repetible con despliegue, versionado y reutilización.

Recomendación de productos y próximos pasos

Una vez detectados los usuarios con propensión de compra, el siguiente reto era decidir qué producto recomendar y cómo activar el mensaje correcto. El artículo planteaba alternativas como matrix factorization, market basket analysis o estrategias conectadas a CRM, email y plataformas publicitarias.

La conclusión principal era que el modelo de propensión es solo un primer bloque dentro de una arquitectura más amplia. La utilidad real aparece cuando se integra con campañas, sistemas de activación y monitorización continua.

Conclusión

Este contenido sigue siendo valioso porque explica cómo pasar de un caso de uso clásico de data science a una implementación de extremo a extremo con componentes cloud, evaluación, despliegue y operación. Para cualquier equipo que quiera aterrizar casos de personalización, marketing intelligence o MLOps aplicado, el enfoque sigue siendo vigente.

Fuente original: https://www.neoland.es/blog/como-crear-una-solucion-de-propension-de-compra+++ title = “Cómo crear una solución de propensión de compra utilizando BigQuery ML y Kubeflow” date = 2021-02-21T11:52:54+01:00 draft = false robots = “index, follow” slug = “kubeflow-como-crear-una-solucion-de-propension-de-compra” summary = “Arquitectura end-to-end para construir un modelo de propensión de compra con BigQuery ML, Kubeflow Pipelines y despliegue en Google Cloud.” tags = [“kubeflow”, “machine learning”, “bigquery”, “big query”, “flujo de datos”] categories = [“Data Engineer”, “Machine Learning”] authors = [“marcusRB”] aliases = ["/kubeflow-como-crear-una-solucion-de-propension-de-compra/"] +++

El caso de uso de propensión de compra es ampliamente aplicable a retail, finanzas, seguros, logística y marketing. El reto no está solo en entrenar un modelo, sino en llevarlo desde una prueba local a una arquitectura que permita automatización, despliegue y consumo real por parte del negocio.

En esta guía recuperada explico una solución de inicio a fin basada en BigQuery ML y Kubeflow Pipelines para identificar qué clientes tienen mayor probabilidad de comprar en una próxima visita. El objetivo es unir analítica, modelado y operaciones ML con una ruta técnica comprensible y aplicable.

Pipeline ML

Arquitectura de la solución

La propuesta se apoya en un flujo progresivo:

  1. Identificar la fuente de datos histórica y cargarla en BigQuery.
  2. Preparar atributos y etiquetas para la tarea supervisada.
  3. Entrenar y evaluar un modelo de clasificación.
  4. Ejecutar predicciones batch y online.
  5. Conectar la salida con CRM, recomendación de producto y activación de campañas.
  6. Monitorizar y reentrenar el modelo cuando cambie el comportamiento del dato.

La idea central es que BigQuery ML permite crear una línea base muy útil sin sacar los datos del entorno analítico y que Kubeflow ayuda a encapsular la automatización para escenarios más cercanos a producción.

Preparación del dataset

El punto de partida es un histórico de comportamiento con información suficiente para construir la etiqueta de clasificación will_buy_on_return_visit. En el ejemplo se utilizan datos de Google Analytics y BigQuery para trabajar con rebotes, tiempo en el sitio y otras señales de comportamiento como atributos iniciales.

La clave aquí no es la complejidad del primer modelo, sino la disciplina del proceso: selección de variables, control del periodo de entrenamiento, limpieza del dataset y trazabilidad de las tablas utilizadas.

Entrenamiento y evaluación

Para este caso se utiliza una regresión logística en BigQuery ML. Es una elección razonable para una primera iteración porque permite interpretar la tarea, establecer una línea base y medir rápidamente si la señal disponible tiene valor predictivo.

La evaluación no debe quedarse en un único indicador. Métricas como ROC AUC ayudan a entender si el modelo es decente, pero el verdadero valor llega al revisar atributos, umbrales, conocimiento de dominio, calidad del dato y siguientes iteraciones de feature engineering.

Predicción batch y predicción online

Una vez entrenado el modelo, la misma arquitectura permite cubrir dos escenarios habituales:

  • Predicción batch para campañas sobre grandes conjuntos de clientes.
  • Predicción online para personalización, activación o decisión en tiempo casi real.

BigQuery resuelve bien la parte batch, mientras que el despliegue del modelo en AI Platform permite exponer un endpoint para inferencia online. Esto abre la puerta a experiencias personalizadas, cupones, automatizaciones y activación coordinada con otros sistemas.

De modelo a activación de negocio

El modelo por sí solo no resuelve el caso de uso. Después hay que conectar la salida con CRM, identificar al cliente, decidir qué producto o incentivo ofrecer y medir el resultado de la campaña. Ese puente entre predicción y operación suele ser lo que separa una demo técnica de una solución útil.

En entornos reales, esto obliga a pensar también en privacidad, matching de identidades, orquestación cloud, versionado de modelos, monitorización y retraining.

Conclusión

La gran ventaja de esta aproximación es que muestra un camino realista desde SQL y analítica web hasta una solución MLOps más seria. No se trata solo de crear un clasificador, sino de preparar una arquitectura capaz de integrarse con campañas, CRM, recomendadores y procesos de negocio.

Fuente original: https://www.neoland.es/blog/como-crear-una-solucion-de-propension-de-compra