Notebooks y datasets del curso de BERT
Un cuaderno de Colab por aplicación, más los datos de cada una. Las dos primeras aplicaciones comparten corpus —el de tuits de Sentiment140—, así que con descargarlo una vez vas servido. Las partes 1 y 2 son teoría y no llevan ficheros.
Aprende BERT, el algoritmo de NLP más avanzado de Google
Del tokenizador al ajuste fino: usa BERT como capa de embedding en tus propios modelos y móntale encima un sistema de respuestas automáticas.
- 10,5 h de vídeo
- Experto 🐸🐸🐸🐸
Aplicación 1: el tokenizador de BERT
- Notebook del tokenizador
Google Colab
Cómo BERT trocea el texto en subpalabras y por qué eso cambia el preprocesado respecto a lo que hacías antes.
- Dataset Sentiment140
Universidad de Stanford · ZIP
1,6 millones de tuits etiquetados por sentimiento, desde la fuente original de Stanford. Sirve también para la aplicación 2.
Aplicación 2: BERT como capa de embedding
- Notebook de embeddings
Google Colab
Enchufar BERT como capa dentro de un modelo propio. Usa el mismo dataset de Sentiment140 de la aplicación anterior.
Aplicación 3: respuestas automáticas con SQuAD
- Notebook del sistema de respuestas
Google Colab
El ajuste fino de BERT sobre SQuAD. El script de evaluación va dentro de este mismo cuaderno, en la celda
v6WquTCiIR7t. - Conjunto de entrenamiento
Google Drive
Las preguntas y respuestas con las que se ajusta el modelo.
- Conjunto de desarrollo
Google Drive
El conjunto con el que se mide si el ajuste ha servido de algo. No lo uses para entrenar.
- Vocabulario
Google Drive
El vocabulario del tokenizador. Tiene que ser exactamente el del modelo preentrenado que cargues, o los índices no cuadran.
Bonus del curso
- Notebook extra
Google Colab
El cuaderno adicional que cierra el curso.
Antes de BERT
Si el Transformer que hay debajo de BERT te suena a chino, la pieza anterior es NLP Moderno en Python, donde se construye uno desde cero.
¿Ejecutar los cuadernos o entender BERT?
Ajustar BERT son cuatro celdas. Saber por qué el vocabulario tiene que coincidir, cuándo congelar capas y qué mirar cuando la métrica no sube es lo que separa copiar de saber. Eso está en el curso.