Entrenar un modelo de IA con el contenido de tu propio WordPress ya no exige un equipo de data science ni escribir una sola línea de Python. Con el plugin WordPress fine-tuning de Cerebroly, todo el proceso se resuelve desde el escritorio de administración: generar el dataset, editarlo, revisarlo y lanzar el entrenamiento contra la API de OpenAI. Lo que separa un modelo mediocre de uno realmente útil no es el botón de «Iniciar entrenamiento», sino lo que ocurre antes de pulsarlo.

Esta guía se centra en eso: cómo configurar el fine-tuning en WordPress, cómo aprovechar el editor de datos y qué buenas prácticas separan un dataset sólido de uno que solo añade ruido a tu chatbot.

Qué necesitas antes de tocar la pantalla de fine-tuning

Antes de abrir la página cerebroly-fine-tuning, conviene tener tres cosas resueltas. Primero, la clave de API de OpenAI configurada y validada desde los ajustes del plugin; sin ella, la pestaña de entrenamiento queda bloqueada. Segundo, contenido publicado y representativo: posts, páginas o archivos subidos que reflejen lo que tus usuarios preguntan realmente. Tercero, paciencia para revisar el dataset antes de entrenar, el paso que casi todo el mundo se salta y el que más impacto tiene en el resultado.

Un detalle que el propio plugin recuerda en la configuración: el contenido procesado para el fine-tuning se envía a los servidores de OpenAI. Revisa qué fuentes activas incluyen datos confidenciales o personales y exclúyelas antes de generar el dataset. El fine-tuning está pensado para conocimiento de cara al público, no para documentación interna sensible.

Configuración paso a paso del plugin de fine-tuning

La pantalla de fine-tuning de Cerebroly se organiza en cuatro pestañas: Resumen, Editor de datos, Vista previa y Entrenamiento. Cada una corresponde a una fase del proceso, y entender qué hace cada una es la base de una buena configuración.

Resumen: el punto de partida

La pestaña Resumen muestra las estadísticas de tu dataset: ejemplos generados, tamaño en KB, palabras procesadas y fecha de la última actualización. Si ya tienes un modelo entrenado, aparece también la tarjeta de modelo activo, con su identificador, estado (activo, procesando o fallido) y fechas de creación y actualización.

También resume el flujo completo en cuatro pasos: preparación de datos, edición opcional, entrenamiento e implementación. Es el mapa; el resto de pestañas son el territorio.

Nota práctica: puedes lanzar un nuevo entrenamiento sin interrumpir el modelo que ya tienes en producción. El modelo anterior sigue respondiendo en tu chat hasta que decides activar el nuevo. No hay downtime entre versiones.

Editor de datos: donde realmente se construye el modelo

Editor de datos: donde realmente se construye el modelo

Esta es la pestaña con más peso en la calidad final del fine-tuning de WordPress. El dataset sigue el formato que exige OpenAI para conversaciones: cada entrada es un objeto con un array messages, con un mensaje role: user para la pregunta y otro role: assistant para la respuesta.

{
  "messages": [
    { "role": "user", "content": "¿Cómo configuro el fine-tuning en WordPress?" },
    { "role": "assistant", "content": "Desde la pestaña Entrenamiento, revisa el dataset y pulsa Iniciar entrenamiento." }
  ]
}

El editor está construido sobre Monaco Editor, el mismo motor que usa Visual Studio Code, con resaltado de sintaxis y validación de esquema JSON en tiempo real. Si el formato no es correcto, el editor te lo indica antes de que puedas guardar, lo que evita subir un archivo mal formado a OpenAI.

Desde la barra de herramientas del editor tienes estas acciones:

  • Añadir Nuevo Par: inserta una entrada vacía para escribir a mano una pregunta y una respuesta concretas. Es la vía correcta para incorporar preguntas frecuentes que tu contenido publicado no cubre de forma explícita.
  • Formatear JSON: reordena e indenta el archivo completo. Necesario en cuanto editas manualmente varias entradas y el formato empieza a quedar irregular.
  • Mejorar con IA: envía tu contenido de WordPress a la API de OpenAI para generar variaciones adicionales de preguntas y respuestas, con más formas naturales de preguntar lo mismo. El plugin avisa antes de lanzarlo: consume tokens adicionales y sustituye el JSON actual por uno generado desde el contenido original, no desde tus ediciones manuales previas.
  • Regenerar Datos Originales: reconstruye el dataset desde cero a partir del contenido de tu WordPress, descartando cualquier edición manual. Útil como botón de reinicio si una edición se ha torcido.

Cada cambio se confirma con el botón Guardar Cambios. No des por hecho que el editor guarda automáticamente: sin ese clic, tus ediciones se pierden al cambiar de pestaña.

Vista previa: la última revisión antes de gastar tokens

Vista previa: la última revisión antes de gastar tokens

La pestaña Vista previa traduce el JSON crudo en algo legible: cada ejemplo se muestra con su pregunta y su respuesta diferenciadas, junto al bloque JSON correspondiente. El título indica cuántos ejemplos se muestran frente al total, por ejemplo «10 de 57».

Este paso no es cosmético: es donde detectas respuestas vacías, preguntas mal formuladas o pares duplicados antes de que formen parte del entrenamiento. Si has editado el dataset, usa Regenerar Vista Previa para ver el resultado actualizado.

Entrenamiento: lanzar el proceso con información completa

Entrenamiento: lanzar el proceso con información completa

La última pestaña resume todo lo necesario para decidir con criterio. En el bloque de información de OpenAI verás el modelo base configurado (GPT-3.5 Turbo por defecto), un tiempo estimado de 30 a 60 minutos, y una referencia de coste: aproximadamente 0,008 $ por cada 1.000 tokens de entrenamiento, más entre 0,012 y 0,016 $ por cada 1.000 tokens de uso posterior. También se muestra el estado de conexión con la API; si hay un error, el botón queda deshabilitado y el plugin enlaza directamente a los ajustes para corregirlo.

Junto a esa información aparece el resumen del dataset a enviar: ejemplos, tamaño y palabras totales. Con menos de diez ejemplos, el plugin muestra una advertencia recomendando ampliarlo. Con todo verificado, el botón Iniciar Entrenamiento sube el archivo al endpoint de fine-tuning de OpenAI y registra el proceso; el estado se actualiza automáticamente al finalizar.

Buenas prácticas para un dataset de fine-tuning que funcione

El fine-tuning amplifica lo que le das. Un dataset cuidado produce un modelo preciso; un dataset descuidado produce un modelo que responde con seguridad cosas equivocadas. Estas son las prácticas que marcan la diferencia:

  • Prioriza la calidad sobre el volumen. Treinta ejemplos bien redactados enseñan más que cien generados sin revisión. La consistencia real del modelo se nota a partir de treinta o cuarenta pares bien curados.
  • Usa «Mejorar con IA» con criterio. Genera variaciones naturales del mismo contenido y ayuda al modelo a reconocer distintas formas de preguntar lo mismo. Revisa siempre el resultado en la Vista previa: la generación automática no sustituye la revisión humana.
  • Elimina respuestas vacías o genéricas. Un par con contenido en blanco enseña al modelo a responder así incluso cuando sí tenías la información. Bórralo o complétalo antes de entrenar.
  • Incluye preguntas reales de tus usuarios. Añade a mano las dudas frecuentes que llegan por soporte, aunque no estén formuladas literalmente en tu contenido publicado.
  • Revisa antes de entrenar, siempre. Un dataset con errores de formato o pares de baja calidad produce un modelo que hereda esos mismos problemas.
  • Mantén el tono coherente en todas las respuestas. Mezclar un tono formal e informal entre ejemplos traslada esa inconsistencia al modelo en producción.

El error más habitual: generar el dataset automáticamente y lanzar el entrenamiento sin pasar por la Vista previa. Dedicar quince o veinte minutos a revisar los ejemplos antes de entrenar suele evitar tener que repetir todo el proceso al día siguiente.

Cuándo el fine-tuning es la pieza que faltaba

El fine-tuning en WordPress tiene más sentido cuando el tono y la terminología importan tanto como la información en sí: documentación técnica de producto, bases de conocimiento corporativas, formación online o soporte especializado. El modelo entrenado responde con tu vocabulario y tus matices, sin repetir instrucciones en cada consulta.

Si tu contenido cambia con frecuencia, combínalo con un sistema RAG: el fine-tuning aporta el tono, el RAG aporta la información actualizada en tiempo real. Ninguna arquitectura sustituye a la otra; se complementan.

Empieza a entrenar tu propio modelo

Configurar correctamente el fine-tuning en WordPress no depende de un botón, depende de la preparación previa: fuentes de contenido bien elegidas, un dataset revisado en el editor y una vista previa comprobada antes de gastar tokens en OpenAI. Con esos tres elementos resueltos, el resto del proceso lo gestiona el plugin.

Descarga el plugin de Cerebroly e instálalo en tu WordPress para empezar. Si todavía no tienes la conexión con OpenAI configurada, revisa primero la guía de configuración inicial del plugin. Y si quieres profundizar en el proceso de entrenamiento paso a paso, esta guía de fine-tuning para WordPress complementa lo visto aquí con más detalle sobre el flujo completo.