¿Qué sucede cuando le pedimos a una IA que piense paso a paso?
En realidad depende con qué IA estés hablando. Te explico...
Hace mucho tiempo, en una galaxia muy, muy lejana, escribí un post sobre una técnica de prompting llamada Chain of Thought (CoT). En realidad fue hace más o menos un año y medio, pero… ¿quién puede resistirse a empezar un post así?
Y digo que fue hace mucho tiempo porque un año y medio en el mundo de la IA es como decir que algo pasó en 1779 😅.
Volviendo a CoT. Es una técnica que consiste en decirle a tu asistente que piense paso a paso antes de responder. Estoy seguro que debes haber visto miles de prompts que incluyen cosas como “explica tu razonamiento paso a paso” o “muéstrame tu proceso de pensamiento”.
Esta técnica realmente mejoraba las respuestas de los modelos, hasta que en algún momento empezaron a aparecer los modelos de razonamiento (esos que están entrenados justamente para razonar antes de responder). En ese momento me pregunté si tenía sentido usar CoT con esos modelos. Investigué un poco, pero la verdad es que la tecnología era tan nueva que nadie sabía aún…
Hoy al fin tengo la respuesta (la verdad es que la tengo hace tiempo, sólo que este post se demoró mucho en salir. Sorry).
Por qué funcionaba CoT
Antes que los modelos de razonamiento lleguen a nuestras vidas, las preguntas que les hacíamos a nuestros asistentes eran respondidas directamente, no importaba si esa respuesta requería pasos previos, simplemente nos daban la respuesta (y no siempre era la mejor).
Y así estaba el mundo de la IA, hasta que en 2022, un grupo de investigadores se dio cuenta que podían hacer que la máquina “piense” antes de responder simplemente agregando en el prompt la frase “piensa paso a paso”. Este cambio tan sencillo mejoraba muchísimo las respuestas de los modelos y todo el mundo empezó a usarlo para todo.
El mecanismo que hace que funcione es bastante sencillo. Resulta que cuando estos modelos generan sus respuestas siempre leen todo lo que han escrito antes de poner la siguiente palabra* y esto hace que justamente cuando les pedimos que piensen, generen una especie de pasos intermedios antes de la respuesta final. Como cuando nos tocaba hacer el procedimiento de una operación matemática para que el profesor sepa que no nos lo habíamos inventado.
Dato curioso: algunos años después se descubrió que esta técnica mejoraba sobre todo las respuestas de matemáticas, lógica y problemas que necesitan varios pasos; para todo lo demás la mejora era mínima.
Y así es que mientras muchos usábamos esta técnica, las cosas en el mundo de la IA empezaron a cambiar…
*En realidad no es la siguiente palabra sino el siguiente token… para saber más sobre eso mira mi post sobre Transformers (no, no son los robots de los 80s, aunque hay varias referencias).
Llegaron los modelos de razonamiento
Estos modelos simplemente fueron entrenados para “pensar” antes de dar su respuesta. De hecho, ahora todos la mayoría de los modelos con que trabajamos son de razonamiento.
Me imagino que te habrás dado cuenta que cuando le preguntas algo a ChatGPT, Gemini o Claude, usualmente antes de ver la respuesta ves un mensaje que dice algo como “pensando…”, “ponderando…” o alguna de sus cientos de variantes; y tal vez has sido lo suficientemente curioso para ver qué es lo que estaba pensando, ¿no?
Pero para qué contártelo si te lo puedo mostrar. Lo primero es hacerle una pregunta que realmente requiera de todo su poder de razonamiento… ya sé!
¿Por qué el cau cau es el mejor plato del mundo?
Y como se trata de una pregunta tan profunda, permíteme usar el modelo más avanzado de Anthropic, Fable 5 (con el setting de esfuerzo al máximo, porque YOLO).
Antes de darme la respuesta Claude se puso a pensar, de hecho pensó un buen par de minutos. El mensaje que ves arriba a la izquierda en la imagen iba cambiando mientras pensaba, de alguna manera contándome por dónde iba su razonamiento. Y todo esto sucedía sin habérselo pedido de forma explícita.
Hoy no sólo la mayoría de modelos son de razonamiento, sino que ellos mismos deciden cuánto razonar en función a la pregunta que le haces (y también al setting de esfuerzo que le pones).
Ahora, la pregunta es:
¿Qué pasa si en el prompt le decimos a un modelo de razonamiento que piense paso a paso?
Pero antes de pasar a esto, te dejo la respuesta que me dio Claude sobre el cau cau.
Claude:
Porque es alquimia pura: agarrar mondongo —un ingrediente que medio mundo mira con desconfianza— y convertirlo en un guiso dorado, aromático y elegante es cocina de verdad, no de ingredientes caros. La combinación tiene una genialidad rara: el palillo pone el color y ese fondo terroso, el ají amarillo el calor amable, la papa en cubitos absorbe todo el juguito, y la hierbabuena al final es el toque que nadie esperaría en un plato de menudencia y que lo cambia absolutamente todo. Fresco donde debería ser pesado.
Y tiene mérito histórico: nace del ingenio criollo y afroperuano de transformar lo que las cocinas “finas” descartaban en patrimonio. Hacer tanto con tan poco vale más que cualquier técnica francesa. Encima es democrático: plato de menú, barato, contundente, con su arroz blanco al costado.
¿El mejor del mundo? La competencia interna es feroz —el ají de gallina y el seco tienen buenos abogados— pero el cau cau ni se molesta en discutir. El que sabe, sabe.
Cuando le pides razonar a algo que ya razona
Antes que nada, recuerda siempre que estás hablando con una máquina, con algo que fue entrenado para actuar de cierta manera, y que en el caso de los modelos de razonamiento han sido entrenados para “pensar paso a paso” antes de dar la respuesta.
Lo que pasa cuando le pedimos a estos modelos que nos expliquen su razonamiento es que les estamos diciendo que la respuesta incluya ese razonamiento… y como toda máquina que ha sido diseñada para trabajar de una manera y es usada de otra… se rompe.
En palabras de almirante Ackbar…
Bueno, no es que literalmente los servidores de tu compañía de IA favorita se vayan a incendiar si le pides a un modelo de razonamiento que piense paso a paso, pero lo más probable es que la respuesta que te dé no sea tan buena.
Tiene sentido, ¿no crees? Si tu asistente fue entrenado para pensar antes de responder y ahora le pides que te cuente su razonamiento, lo que va a pasar es que se va a poner a pensar en cómo responder sobre su pensamiento (perdón por el trabalenguas) en vez de responder. Podrías decir que lo estás obligando a responder tu pregunta y a pensar en cómo inventarse un razonamiento que justifique esa respuesta. Todo mal.
Pero antes que descartes por completo esta técnica, hay un pequeño detalle que deberías saber…
Todo depende…
Como todo en la vida, depende, y en este caso va a depender de la IA con la que estés hablando. Esto podría parecer obvio (duh!), pero mucha gente no se detiene a pensar si su asistente (o su API) está usando un modelo de razonamiento o no.
¿Acaso hay alguna respuesta que suene más a consultor que “depende”?
(o “it depends”, si lo prefieres en inglés).
Para los que usamos asistentes como Claude, Gemini o ChatGPT podemos estar tranquilos y dejar de usar CoT, todos sus modelos actuales razonan.
Si eres un poco más técnico y estás usando un modelo via API, vale la pena estar seguro cuál es antes de dejar de usar CoT.
Y ese fue el post de hoy, por favor recuérdalo. Que no me digan que te vieron por ahí usando Chain of Thought 😅.
…pero antes de irme…
El cau cau
Luego que Claude me confirmara que este es el mejor plato del mundo mundial, no podía irme sin presentártelo formalmente.
Si me lees hace un tiempo seguramente ya lo conoces, si eres nuevo por aquí te cuento que es una delicia de la cocina peruana hecha con mondongo, papa, hierbabuena y un aderezo que te mueres. Se come con arroz y es bueno para desayuno, almuerzo y cena.
Aquí te dejo una foto para que lo conozcas bien.
Ahora sí, mi misión aquí está cumplida, ya sabes un poco más de CoT y de gastronomía peruana.
Nos vemos en el próximo post.
Abrazo,
G







Útil y divertido. Posteo nivel cau cau