Versión podcast
GPT-4 es un modelo de lenguaje mucho más potente, pero ¿Qué pasaría si dijera que el rendimiento que estamos viendo hoy de GPT-4 es solo la superficie?.
Veamos las formas en las que GPT-4 va a evolucionar en los próximos meses para que podamos preparar nuestros proyectos y aprovechar la ventaja.
VENTANA DE CONTEXTO
Cuando hablamos de modelos como GPT-3 o GPT-4, estamos hablando de modelos cuya tarea de entrenamiento es aprender a predecir cuál es el siguiente token a partir de los tokens anteriores. Son modelos autoregresivos. Aquí tenemos concepto muy importante, ventana de contexto.
El tamaño de la ventana de contexto, indica cuánta información puede procesar para poder crear su siguiente predicción o respuesta.
Cuando trabajamos con modelos como GPT-3 o ChatGPT, sus ventanas de contexto se expanden hasta los 4096 tokens, que son, aproximadamente, entre 2000 y 3000 palabras. Con esta ventana de contexto, cuando la conversación se vuelve muy larga, ChatGPT tiende a olvidar cierta información, porque queda fuera de su ventana de contexto.
Con GPT-4, esta ventana se duplica inicialmente hasta los 8000 tokens, pero no es la versión definitiva. OpenAI anunció que la versión definitiva de este modelo, tendrá una ventana de contexto de 32000 tokens (unas 25000 palabras o 50 páginas de documento). 50 páginas que ahora GPT-4 podrá escanear y analizar y procesar simultáneamente para generar su siguiente respuesta.
Esta ventana de contexto se vuelve extremadamente útil cuando queremos agregar mucha información contextual para resolver una determinada tarea, agregar páginas de documentación, información de una base de datos, varios papers que quieras comparar o por ejemplo, gran parte del código de un proyecto de programación que ahora GPT-4 podrá observar simultáneamente.
Esta ventana de contexto era uno de los grandes cuellos de botella de modelos como GPT-3.
CONSEJO IMPORTANTE 8 de mar – Debemos aprovechar esta oportunidad para utilizar DOCUMENTOS DE DEFINICIÓN sobre SEO, SEM … y branding que nos permita generar respuestas consistentes en nuestros proyectos.
MULTIMODALIDAD
GPT-4 incorpora la capacidad de ir más allá de leer y generar texto, ahora puede aceptar otro tipo de datos, como pueden ser imágenes (funcionalidad activa en los próximos meses, seguramente cuando lo hayan optimizado para reducir su coste computacional). Esto abre una dimensión completamente nueva en las capacidades que este modelo podrá demostrar.
Greg Brockman, cofundador de OpenAI, el día de la presentación de GPT-4, dibujó un boceto de una interfaz en su libreta, y demostró como el sistema pudo entender la imagen, entender el texto, entender la interfaz que tenía que programar y conectar todo esto, a su capacidad de generar texto y generar código de programación.
En cuestión de segundos, creó el código que implementaba dicha interfaz completa.
La “visión” de GPT-4 nos permite ahora dejar que la IA haga razonamientos sobre lo que ve, o pasarle un diagrama y que te explique y desarrolle qué es exactamente lo que estás viendo.
En los próximos meses veremos un montón de asistentes, avatares artificiales, robots … que conectados con esta tecnología van a dialogar de forma natural con nosotros.
CONSEJO IMPORTANTE 8 de mar – Debemos aprovechar esta oportunidad para integrar asistentes en nuestras webs y apps con respuestas más eficaces.
NUEVO INTÉRPRETE PARA USUARIOS
GPT-4 está muy bien, pero interactuar siempre a través de un chat o solamente compartiendo imágenes, quizás no sea la forma más natural para sacarle todo el rendimiento a este modelo.
Además, sabemos que el rendimiento de estos modelos depende de cómo se configura el prompt inicial, donde el “cómo” se exprese la idea de la tarea que quieres pedir o el propio orden de las palabras, tiene un impacto real sobre el rendimiento final.
¿Y si pudiéramos utilizar una interfaz gráfica que esté pulida y muy optimizada para dar siempre el mejor resultado?
En los próximos meses veremos como toda la complejidad de interactuar en crudo con el modelo del lenguaje se elimina con una interfaz gráfica sencilla, donde tras cada menú se va a esconder el prompt concreto que hace que el modelo del lenguaje actúe como queremos.
CONSEJO IMPORTANTE 8 de mar – Debemos instalar un intérprete visual en nuestras webs y apps para trabajar con prompts, más complejos y a la medida de nuestras necesidades, pero de una forma sencilla y directa.
INTERCONEXIÓN
GPT 4 dispondrá de capacidad para poder utilizar herramientas externas.
Un ejemplo … sabemos que chat GPT, por su propia naturaleza y funcionamiento, no es muy bueno con las matemáticas. Pero ¿Y si le dieras la posibilidad de reflexionar sobre qué herramienta debería de utilizar?
Puede deducir que para este prompt lo ideal sería utilizar una calculadora y si le das acceso a ella, el modelo la utilizará para darte el resultado correcto.
Otro ejemplo … GPT-4 técnicamente no sabe en qué fecha vive. Algo fundamental para organizar, por ejemplo, una agenda. Pero qué pasaría si le diéramos acceso a algo tan sencillo como un calendario y además le damos capacidad para poder leer eventos, agregar las reuniones que le pidamos, añadir recordatorios.
Aquí GPT-4 se vuelve mucho más interesante, cuando le damos capacidad de acceder a otras herramientas, buscadores, calendarios, APIs, etc. Las posibilidades son infinitas y se introducen los PLUGINS ( probablemente con marketplace ).
¿Qué es un plugin en este caso? Una forma de conectar chat GPT con una API de una aplicación externa para, por ejemplo … pedirle que te gestione la compra de un vuelo a Nueva York.
Pero puede ser más elaborada y podemos dejar que chat GPT interactúe en cadena con diferentes aplicaciones.
Podemos pedirle, por ejemplo … organiza un viaje y una cena en la ciudad europea que esté más cerca de donde estoy yo ahora y ahí chat GPT irá a Wolfram Alfa para calcular las distancias a las diferentes ciudades europeas. Luego encontrará el vuelo más óptimo para tu viaje y finalmente los restaurantes donde poder cenar. ¿Veis el potencial? Una simple actualización vuelve mucho más potente a toda esta tecnología.
Pero el tema de los plugins no se queda sólo ahí. Tendrá la capacidad de poder navegar por Internet, pudiendo entrar en diferentes páginas web, extraer información y volcarla en el chat para poder seguir hablando sobre ella.
Y muy interesante, también han añadido un intérprete del lenguaje de programación Python que le va a permitir generar código y ejecutarlo según lo necesite.
Y esto ya no nos lleva a una IA ejecutando una calculadora.
Esto es una IA generando y ejecutando código de programación bajo demanda. Y eso abre muchas, muchísimas, posibilidades.
Pero ¿y si os dijera que la cosa no se queda aquí? Está muy bien darle a GPT-4 acceso a una calculadora, a un calendario, a APIs, a código de programación … pero vamos más allá.
Imaginad que le damos acceso a todo el catálogo de modelos de Deep Learning que están preentrenados y están disponibles (como por ejemplo Whisper, que es capaz de “escuchar”).
Hace muy pocos días se ha publicado un paper llamado Hugging GPT, donde ya se usa chat GPT como un cerebro que coordina el uso de los diferentes modelos disponibles.
Con todo esto tenemos a un futuro GPT 4 que es muchísimo más potente que cualquier otra cosa que tengamos hoy entre manos.
El uso de GPT 4 está siendo tan intensivo por parte de la comunidad que en muy pocos días se han encontrado nuevas estrategias que permiten aumentar el rendimiento del modelo.
CONSEJO IMPORTANTE 8 de mar – Debemos crear plugins y APIs para cada proyecto que permitan a los modelos de lenguaje interactuar con nuestra información.
METACOGNICIÓN
En breve se podrá introducir a chat GPT en un bucle continuo que le permitirá evaluar y ser crítico sobre los resultados que ha generado previamente.
Este proceso de “autorreflexión” le permite observar sus estados anteriores generando un bucle de optimización.
Podemos ver un ejemplo en el paper llamado auto GPT, donde empieza a ejecutar un bucle con los siguientes pasos:
- Analiza su objetivo
- Planifica los pasos a seguir
- Ejecuta esos pasos
- Posteriormente, de forma iterativa
- Va corrigiendo errores
- Analizando sus outputs
- Generando test
- Analizando su outputs de nuevo
- Planificando los siguientes pasos
- y así hasta completar el objetivo fijado
Auto GPT, es un chat GPT en modo automático.
CONSEJO IMPORTANTE 8 de mar – Debemos crear un sistema que permita evolucionar a los proyectos con servidores dedicados, de esa forma, los modelos serán cada vez más eficientes al ser capaces de corregir los resultados en función de nuestros propios objetivos.
REFLEXIÓN
Estamos sólo al comienzo de esta revolución y tenemos que entender que GPT4, por impresionante que nos parezca ahora, está en la peor versión de todos los modelos que están por llegar en el futuro.
No hace falta esperar a un hipotético GPT5 que se esté entrenando, GPT4 ya supone una base muy potente para introducir grandes mejoras conectando todas las claves que hemos visto en un único sistema y construir herramientas que puedan sacarle todo el partido a esta tecnología.
El momento de aprovechar esta situación es AHORA. Si todavía no has preparado tu proyecto para aprovechar esta situación, contacta con el gestor de tu caso en 8 de mar para activarlo cuanto antes.

