Pre-entrenamiento

Pre-entrenamiento

Definición

El preentrenamiento es el entrenamiento inicial de un modelo de aprendizaje automático en grandes conjuntos de datos de propósito general antes de realizar ajustes en tareas específicas.

Propósito

El objetivo es proporcionar modelos con representaciones amplias que se puedan transferir a múltiples tareas, reduciendo los requisitos de datos y de cómputo para la adaptación posterior.

Importancia

  • Fundación para LLMs modernos y modelos de visión.
  • Mejora el rendimiento en diversas tareas.
  • Costoso en términos de datos y computación.
  • Requiere una cuidadosa conservación del conjunto de datos para evitar sesgos.

Cómo Funciona

  1. Recopilar conjuntos de datos generales masivos (texto, imágenes).
  2. Definir tareas de aprendizaje no supervisadas o autosupervisadas.
  3. Entrenar modelos para aprender características generales.
  4. Guarde las pesas previamente entrenadas para reutilizarlas.
  5. Ajuste conjuntos de datos más pequeños y específicos de tareas.

Ejemplos (mundo real)

  • BERT pre-entrenado en Wikipedia y BooksCorpus.
  • CLIP entrenado en pares imagen-texto.
  • Modelos GPT preentrenados en texto de Internet a gran escala.

Referencias / Lecturas adicionales

  • Devlin et al. “BERT: Preentrenamiento de transformadores bidireccionales profundos”. NAACL 2019.
  • Radford et al. “Los modelos lingüísticos son aprendices de pocas oportunidades”. NeurIPS 2020.
  • Informe técnico de OpenAI GPT-4.

Cuéntenos cómo podemos ayudarlo con su próxima iniciativa de IA.