Amadeus: Buscando solventar la memoria de pez de los LLMs.

Share
Amadeus: Buscando solventar la memoria de pez de los LLMs.

Desde la irrupción de ChatGPT con GPT-3.5 en 2022, los chatbots de IA han pasado a formar parte de nuestra vida diaria. Actualmente en España, entre el 35 y el 40 por ciento de las personas entre los 16 y los 74 años utiliza alguna de estas herramientas. Sin embargo, pese a la gran adopción, varias de las quejas habituales de los usuarios de estas plataformas han estado relacionadas con la memoria —o mejor dicho, con la falta de ella— de los LLMs. Problemas como un mayor tiempo de respuesta en conversaciones largas, los olvidos de información clave dentro de una misma conversación o la falta de persistencia entre sesiones son, en gran medida, inherentes a los LLMs y a las formas actuales que tenemos de gestionar su memoria.

En este artículo se busca facilitar la comprensión de por qué ocurren estos problemas, exponer una posible solución, y, finalmente, animar a más personas a continuar investigando alternativas.


1.1 - Problema: La memoria de pez.

Es todo un clásico: se le da al chatbot una instrucción clara y concisa —tomemos como ejemplo «Cuando te pida que arregles un fragmento de código, no me devuelvas solo las líneas modificadas, devuélveme el código completo con el parche aplicado»— y que cinco iteraciones más tarde se haya olvidado por completo y vuelva a cometer el mismo error.

Este comportamiento se debe a lo que denominamos ventana de contexto. Cada vez que interactúas con un LLM, aunque no lo parezca, el modelo no recuerda nada de las interacciones anteriores. Esto aplica a todos los LLMs, ya sean chatbots, agentes de código, etc. Realmente un LLM es una función que, tomando como entrada (parámetro de la función) un texto, genera una salida con otro texto que, gracias a las matemáticas, parece una respuesta coherente a lo que le hayamos dicho antes.

No existe memoria persistente entre ejecuciones. La única forma de simular retroalimentación es incluir manualmente el historial en el contexto de entrada. Es precisamente esto lo que se hace para lograrlo. Sin embargo, existe una limitación fundamental: la ventana de contexto.

La ventana de contexto es el límite máximo de tokens que puede manejar un modelo a la vez. En los modelos más recientes, a fecha de publicación de este artículo, este límite está en torno al millón de tokens. En cuanto esta ventana es superada, el modelo no es capaz de procesar todos los tokens, por lo que comienza a recortar. Cuando ya no caben más datos, la ventana se desplaza, eliminando lo viejo para dar prioridad a lo nuevo. Incluso antes de alcanzar el límite, la información antigua pierde peso debido a cómo funciona la atención en los transformers.

La imagen ilustra que un LLM solo puede “recordar” una cantidad limitada de información reciente (la ventana de contexto). A medida que la conversación crece, los mensajes antiguos se descartan y dejan de influir en la respuesta.
Fuente: https://timwappat.info/understanding-context-windows-in-llms/

Sabiendo que aproximadamente una palabra equivale a 1,4 tokens (en inglés, en español está en torno a 1,9 tokens), podemos asumir que para saturar un modelo de gama alta actual se requieren algo más de 700k palabras. Aunque pueda parecer mucho, hay que tener en cuenta que esto no incluye únicamente los prompts y la salida: además del texto visible, el modelo puede utilizar tokens adicionales internos durante el proceso de generación, lo que en la práctica reduce la capacidad útil del contexto disponible para el usuario. Es decir, aunque parezca una cantidad elevada, en una conversación técnica prolongada o al trabajar en una base de código muy extensa con cambios sustanciales, es perfectamente alcanzable.

No obstante, la mayoría de empresas de IA no permiten pasar de los 128k/256k tokens a los usuarios comunes. Esto se debe a que los mecanismos de atención de los transformers tienen una complejidad aproximadamente cuadrática respecto al número de tokens: Coste ∝ n². Hoy en día hay mitigaciones parciales que logran reducir el coste computacional —que mencionaremos más adelante— , pero sigue siendo demasiado alto. No podemos ampliar el hardware para inferencia a la misma velocidad que crece la necesidad de un mayor contexto, y mucho menos costearlo los usuarios finales, en un espíritu similar a la ley de Moore. Los modelos con 1M context suelen estar reservados como productos facturados aparte, dentro de la API, o por ejemplo en Claude Code, que ofrece Opus y Sonnet 1M pero facturado fuera de la suscripción mensual.

Gráfico que muestra cómo el coste energético (en julios) de procesar un contexto en un modelo Transformer crece de forma cuadrática al aumentar el número de tokens.
Elaboración propia. Consumo energético en julios para tokens de 0 a un millón.

En los chatbots web, al estar orientados a un público menos especializado, se opta por presentar la información de forma más accesible. Por ello, a diferencia de los agentes de código —que otorgan mayor libertad al usuario para decidir cuándo compactar el contexto—, es habitual que los chatbots web realicen compactaciones de contexto de manera recurrente durante la conversación, sin notificarlo al usuario: generan resúmenes del historial para evitar incluirlo íntegro en el contexto de entrada. Por ello, pese a que las ventanas de contexto han crecido considerablemente en los últimos años, estos casos aún son posibles para quienes hacemos un uso intensivo de la IA:

Caso real resumido donde saturo tanto la ventana de contexto de ChatGPT que falla al responder una pregunta, a priori, sencilla.
Elaboración propia en https://www.fakemess.com/ basada en un caso real.

No obstante, antes de echarle la culpa a la IA, hagamos un pequeño ejercicio mental. Responde a las siguientes preguntas en alto, y sin pensar mucho:

  • ¿De qué color es la nieve?
  • ¿De qué color son las nubes?
  • ¿De qué color es el papel?
  • ¿De qué color es la sal?
  • ¿De qué color es la leche?
  • ¿De qué color es un oso polar?
  • ¿De qué color es una pared recién pintada?
  • ¿Qué beben las vacas?

Si para la última pregunta respondiste «leche», aunque fuera de forma fugaz, el contexto te ha jugado una mala pasada. Es un ejemplo de cómo el entorno inmediato puede condicionar nuestra respuesta. Y sin embargo, a diferencia de un LLM, probablemente te diste cuenta del error casi de inmediato. ¿Por qué? Presumiblemente porque en un primer momento respondiste usando tu memoria de trabajo, que en ese instante se encontraba saturada con un tema concreto y generó una respuesta errónea. Sin embargo, al analizar la pregunta con más calma, la memoria semántica y la episódica te recordaron que no, que las vacas no beben leche.

La ventana de contexto desempeña un papel análogo al de la memoria de trabajo humana. Sin embargo, a diferencia del cerebro, los LLMs carecen de mecanismos equivalentes a la memoria episódica o semántica persistente.

En la siguiente sección del artículo, analizaremos cuán diferente es la memoria entre un humano y un LLM.


1.2 - Contexto ≠ Memoria. ¿Qué es la memoria?

Para entender qué le falta a un LLM, tiene sentido partir de cómo funciona la memoria en el único sistema que sabemos con certeza que es inteligente: el cerebro humano. De esta base nace el planteamiento de Amadeus: comparar las capacidades actuales de los LLMs con las del cerebro humano.

Como dejaba caer en la primera sección del artículo, es razonable trazar un símil entre la memoria de trabajo humana y la ventana de contexto de un LLM. Pero, ¿qué es la memoria de trabajo?

"La memoria de trabajo es un sistema cognitivo de capacidad limitada que permite mantener y manipular activamente información en la mente durante un breve período de tiempo, con el fin de guiar el pensamiento, el aprendizaje y la acción en curso."

Diagrama de flujo sobre el proceso de la memoria humana: la información pasa de la memoria sensorial a la memoria a corto plazo mediante un proceso de análisis (identificación del estímulo, reconocimiento de patrones y nombrado). Desde la memoria a corto plazo, a través de la repetición y la elaboración, se consolida en la memoria a largo plazo, que incluye tipos como declarativa, semántica, procedimental y episódica.
Por User:Antonsusi - File:Gedächtnis modell.svg, CC BY-SA 4.0, https://commons.wikimedia.org/w/index.php?curid=67674175

La memoria de trabajo (o corto plazo), tal y como lo define la neurociencia, es un sistema cerebral que permite almacenar información temporalmente mientras es manipulada para permitir la realización de una tarea determinada. Es el sustrato sobre el que opera el monólogo interno para generar el flujo de texto que muchos sentimos en el interior de nuestra cabeza. La clave de esto es que esa memoria de trabajo es:

  • Temporal
  • Limitada

Realmente un LLM se comporta a efectos prácticos como si aislaras el monólogo interno y la memoria de trabajo del resto del cerebro. Mi hipótesis es que para permitir que los LLMs den un importante salto cualitativo, debemos construir a su alrededor el resto de sistemas de memoria, que son más a largo plazo, reservando la memoria de trabajo para lo que realmente está diseñada.

La memoria como proceso, es un sistema superlativamente complejo, que involucra varias áreas del cerebro en diferentes fases. Por ello, sería muy difícil y osado para mí intentar describir su funcionamiento como si un neurocientífico fuera. No obstante, invito al lector a hacer un ejercicio de introspección y que piense en cómo recuerda cosas.

Es de lo más habitual que, tras haber olvidado algo, sobre todo, cuando se trata de un dato muy particular, intentemos forzar a nuestra mente a recordar lo que buscamos, transportándonos mentalmente, por ejemplo, al momento en el que lo aprendimos o recordando la impresión que nos causó. Pero realmente, exceptuando estos casos, ¿realmente hace falta forzarse para recordar cosas?, ¿Acaso no recordamos muchas veces eventos "sin querer"?

Es aquí donde mi hipótesis más sentido parece tener. Como muestra el diagrama anterior se observa cómo inicialmente la información viaja desde la memoria de trabajo hacia la memoria a largo plazo. Pero así como recordamos cómo hacer un sistema de dos ecuaciones con dos incógnitas usando el método de reducción al verlo en el papel, tras cinco años sin hacer ninguno, la información parece viajar también desde la memoria a largo plazo, hacia la memoria de trabajo. Este flujo bidireccional parece ser la clave.

Por Images are generated by Life Science Databases(LSDB). - from Anatomography, website maintained by Life Science Databases(LSDB).You can get this image through URL below. 次のアドレスからこのファイルで使用している画像を取得できますURL., CC BY-SA 2.1 jp, https://commons.wikimedia.org/w/index.php?curid=7887142

Dentro de la memoria a largo plazo hay varios subsistemas, de los cuales solo voy a tratar dos. La memoria episódica, y la memoria semántica, ambas englobadas en lo conocido como memoria "declarativa". La memoria prospectiva la descarto por no lograr una comprensión de esta lo suficiente como para incluirla en este artículo. También descarto la memoria procedimental, más vinculada a habilidades motoras que a procesos cognitivos de alto nivel, y por tanto menos relevante para los propósitos de este artículo.

La distinción entre ambos subsistemas es, de hecho, clave para entender cómo se recupera y transfiere la información hacia la memoria de trabajo. La memoria episódica es un sistema que agrupa/recupera recuerdos mediante una asociación cronológica lineal, y la memoria semántica es un sistema que agrupa/recupera recuerdos mediante una asociación semántica.

Hasta ahora hemos logrado imitar el comportamiento de ciertas partes del cerebro, pero esta imitación parcial es lo que nos limita a la hora de tener agentes más inteligentes.


1.3 - Mitigaciones incompletas.

Actualmente, las empresas líderes del sector emplean diversas técnicas para mejorar la eficiencia de sus modelos y reducir la pérdida de calidad en las respuestas. En esencia, todas ellas buscan optimizar el uso del contexto, moldeándolo para hacerlo más eficiente y aprovechar al máximo la ventana disponible.

Sin embargo, todas estas soluciones comparten una característica fundamental: no resuelven el problema de fondo, sino que lo desplazan.

Funcionan —y algunas lo hacen francamente bien en entornos de producción—, pero lo hacen dentro de las limitaciones inherentes del propio modelo. Ninguna de estas técnicas altera la naturaleza fundamental de los LLMs: sistemas sin memoria persistente, con una capacidad de contexto finita y un coste computacional que crece de forma no sostenible a medida que este aumenta.

En otras palabras, todas ellas son intentos de meter más información en el mismo espacio limitado, sacrificando precisión, fidelidad o coherencia en el proceso. Esto las convierte en herramientas útiles, pero insuficientes a largo plazo.

A continuación, se describen algunas de las más relevantes y sus principales limitaciones:

1.3.1 - Compactación.

La compactación es una técnica ampliamente utilizada, especialmente dentro de una misma conversación. Consiste en reemplazar el historial completo por un resumen generado por el propio LLM, reduciendo así el número de tokens necesarios.

Es un enfoque sencillo y efectivo, pero introduce un problema clave: la compresión con pérdida.

Al resumir, el modelo elimina detalles que considera secundarios. Sin embargo, esos detalles pueden resultar críticos en iteraciones posteriores. Además, este proceso no es neutro: introduce errores y sesgos en la representación del contenido original. Con cada nueva compactación, el modelo pasa a trabajar sobre una versión cada vez más abstracta —y potencialmente distorsionada— del pasado. Este efecto acumulativo provoca que, tras varias iteraciones, una parte significativa de la información original se haya perdido o alterado.

1.3.2 - Parafraseo.

El parafraseo busca reducir el número de tokens reformulando el contenido en versiones más compactas, manteniendo —en teoría— el mismo significado.

En la práctica, esto equivale a una forma de compresión semántica.

Puede ser útil en contextos muy concretos, pero presenta limitaciones claras. El lenguaje natural no es perfectamente redundante: pequeñas variaciones en la expresión pueden introducir ambigüedades o alterar matices importantes.

En enfoques más agresivos, como el uso de versiones ultra-simplificadas del lenguaje (por ejemplo, eliminando palabras no estrictamente necesarias), la reducción de tokens es significativa, pero el coste en calidad es elevado. Se pierde expresividad, precisión y, en muchos casos, claridad.

En última instancia, el parafraseo no elimina información irrelevante: la transforma, lo que puede derivar en una degradación progresiva del significado a medida que se aplica repetidamente.

1.3.3 - RAG.

El enfoque RAG es, probablemente, el más sólido y extendido en la actualidad. Consiste en fragmentar la información en pequeñas unidades (chunks), generar representaciones vectoriales de estas, y recuperar dinámicamente las más relevantes en función del contexto actual del modelo. De este modo, en cada iteración se añaden al prompt los fragmentos más similares semánticamente a la consulta, normalmente seleccionados a partir de una base de datos vectorial.

Este enfoque permite manejar grandes volúmenes de información sin necesidad de mantenerlos permanentemente en el contexto, y constituye la base de muchos sistemas modernos que simulan memoria entre conversaciones. No obstante, también presenta limitaciones importantes.

En primer lugar, el modelo no recuerda en sentido estricto: no existe estado interno persistente. Cada interacción depende completamente de qué información externa se recupere y se inyecte en el prompt.

En segundo lugar, la calidad del sistema depende críticamente del proceso de recuperación. La similitud vectorial no equivale a relevancia real: fragmentos importantes pueden no ser recuperados, mientras que otros menos relevantes pueden introducir ruido.

Además, RAG no construye una representación estructurada del conocimiento. No traza relaciones causales ni mantiene continuidad temporal. Se limita a recomponer el contexto a partir de piezas independientes, sin una verdadera noción de historia o experiencia.

Por último, este enfoque se apoya completamente en el espacio de representaciones vectoriales (embeddings), que es una aproximación imperfecta de la semántica. Esto introduce un límite fundamental en la calidad de las asociaciones que puede realizar.

1.3.4 - Comparación.

Aspecto Compactación Parafraseo RAG
Coste Computacional Bajo (resumen LLM) Bajo-Medio (reformulación) Medio-Alto (embeddings + búsqueda)
Pérdida de Información Muy Alta (compresión lossy acumulativa) Media-Alta (transformación semántica) Media (depende de similitud vectorial)
Escalabilidad de Contexto No (sigue limitado a ventana) No (sigue limitado a ventana) Sí (ilimitado en teoría)
Persistencia entre Sesiones No No Parcial (mediante DB vectorial)
Relaciones Causales No No No (solo similitud)
Continuidad Temporal No No No (fragmentos aislados)
Complejidad de Implementación Trivial Trivial Media (embeddings, DB)
Degradación con Iteraciones Exponencial (resumen del resumen) Exponencial (paráfrasis de paráfrasis) Lineal (busca en DB limpia)
Efecto en Precisión ↓ Rápido ↓ Gradual ↔️ Estable
Soluciona el Problema No, lo pospone No, lo pospone Parcialmente (memoria sin cognición)

En esencia, las tres primeras técnicas comparten un denominador común: intentan meter más información en el mismo espacio limitado. Compactación y parafraseo sacrifican información irreversiblemente. RAG evita la pérdida mediante almacenamiento externo, pero no crea cognición real: es recuperación sin comprensión.

2 - AMADEUS

LA PROPUESTA

Amadeus es un sistema de memoria para modelos de lenguaje que combina estructuras episódicas y semánticas con un proceso continuo de activación y competición de recuerdos. Obtiene su nombre del Amadeus System de la visual novel Steins;Gate 0, la cual sirvió en buena medida de inspiración para este sistema.

El sistema se compone de:

  • Un LLM que actúa como memoria de trabajo y motor de razonamiento.
  • Un grafo de memoria episódica basado en eventos cronológicos.
  • Un grafo de memoria semántica construido a partir de relaciones entre conceptos.
  • Un conjunto de variables de estado interno que modulan el comportamiento del sistema.
  • Un proceso de consolidación que transforma memoria episódica en conocimiento semántico.
  • Módulos especializados encargados de evaluar relevancia, importancia y relaciones semánticas.

A diferencia de los sistemas clásicos de recuperación, Amadeus no utiliza consultas explícitas generadas por el modelo, sino que implementa un mecanismo de activación continua en el que los recuerdos compiten en función de su relevancia, contexto y relación con el estado actual.

El resultado de este proceso se integra en el contexto del modelo de lenguaje antes de la generación, permitiendo que la memoria influya en el razonamiento sin requerir llamadas explícitas por parte del modelo.


2.1 - La arquitectura de Amadeus.

Amadeus no es un chatbot con memoria. Es un sistema cognitivo continuo inspirado en la arquitectura del cerebro humano, donde cada módulo replica la función de una región neurológica real. El modelo de lenguaje —un Qwen3-8B parámetros ejecutado localmente vía Ollama— actúa únicamente como intérprete consciente: recibe contexto, razona y genera una salida, pero no almacena nada por sí mismo. Toda la cognición vive en el sistema que lo rodea.

El núcleo del sistema se organiza en torno a varios módulos principales. El hipocampo gestiona la memoria episódica mediante un grafo de experiencias, con el giro dentado encargándose de separar patrones similares para que episodios parecidos no se confundan, y CA3 facilitando el completado de patrones y las asociaciones entre recuerdos. El neócortex, por su parte, almacena memoria semántica: conceptos abstraídos a partir de experiencias repetidas que han superado un umbral de evidencia.

La amígdala evalúa la importancia de cada experiencia combinando cinco factores: carga emocional, novedad, repetición, relevancia en contexto y alineación con el conocimiento existente. Esta puntuación determina cuánto peso tendrá un recuerdo en el futuro. El tálamo mantiene el estado interno del sistema —curiosidad, fatiga, estrés, interés, aburrimiento— y estas variables modulan de forma continua tanto la codificación de nuevas memorias como la recuperación de las existentes.

La recuperación de memoria está a cargo del cíngulo posterior, que implementa activación en cascada sobre el grafo para propagar relevancia desde los nodos semilla, aplica diversificación MMR para evitar que todos los recuerdos recuperados sean demasiado similares, y usa propagación PPR para ponderar la importancia estructural de cada nodo en el grafo. El resultado es un conjunto de memorias episódicas y semánticas que se inyectan como contexto al LLM antes de cada respuesta.

El córtex prefrontal orquesta el bucle ejecutivo principal. Cada aproximadamente 30 segundos, el ContinuousThinker recupera memorias relevantes, lee el estado interno del tálamo, construye el prompt y lo envía al LLM. El modelo devuelve un objeto JSON estructurado con el pensamiento generado, su tipo y los nodos de memoria vinculados. Si el pensamiento incluye llamadas a herramientas —búsqueda web, ejecución de código en Docker, lectura de URLs, mensajes por Telegram—, el módulo de autonomía en el área de Broca las ejecuta. El source monitor etiqueta cada pieza de información resultante con su procedencia: OBSERVED si viene de evidencia directa de una herramienta, INFERRED si es una deducción, PLAN si es una intención futura, o SOCIAL_CLAIM si es algo que alguien ha dicho pero no se ha verificado.

Cada episodio almacenado en el hipocampo tiene una fuerza compuesta que combina recencia (30%), frecuencia de acceso (20%), importancia asignada por la amígdala (35%) y confianza (15%). Esta fuerza decae con el tiempo siguiendo una función exponencial con curvatura sublineal, de forma que los recuerdos recientes caen rápidamente y los muy antiguos decaen cada vez más despacio. Cuando la fuerza cae por debajo de 0.15, el recuerdo deja de ser recuperable; si cae por debajo de 0.05, se elimina definitivamente.

Cada cuatro horas, o cuando se han acumulado más de 20 nuevas memorias, el sistema entra en un ciclo de consolidación offline que simula el sueño. Durante este proceso se reproducen y recombinan los episodios más relevantes, se detectan patrones repetidos, se extraen entidades y, si un conjunto de episodios similares supera los umbrales de tamaño de clúster, importancia y consistencia, se promueven al neócortex como conocimiento semántico estable. Al mismo tiempo, el giro dentado aplica decaimiento y elimina las memorias que han caído por debajo del umbral de borrado.

El almacenamiento físico de todo este grafo vive en SurrealDB, una base de datos que soporta tanto nodos y aristas como búsqueda vectorial. Las representaciones vectoriales se generan con el modelo BAAI/bge-base-en-v1.5 (768 dimensiones), lo que permite encontrar recuerdos por similitud semántica además de por conexiones explícitas en el grafo. La única interfaz externa de entrada y salida es Telegram, intencionadamente reducida a infraestructura de transporte para mantener toda la lógica cognitiva dentro del sistema.

La evaluación empírica de Amadeus frente a enfoques más clásicos, como RAG simple o sistemas basados únicamente en compactación de contexto, queda fuera del alcance de este primer artículo. Dicha comparación requiere un banco de pruebas específico —con métricas de retención, recuperación, coherencia entre sesiones y degradación temporal— y será abordada en una segunda parte dedicada exclusivamente a benchmarking.


2.2 - Problemas de Amadeus

A pesar del potencial que parece tener Amadeus, sigue estando muy lejos de ser un sistema cognitivo completo. Las limitaciones de Amadeus vienen precisamente por mantenerse en el paradigma LLM, actuando como un parche sobre este.

Como vimos en la tabla de mitigaciones (Sección 1.3), Amadeus "teóricamente" soluciona el problema. Pero estas cuatro limitaciones fundamentales muestran por qué, en la práctica, sigue siendo un parche que no resuelve el problema de fondo.

El que dependa de un LLM hace que realmente, siga siendo una "habitación china" —el experimento mental de John Searle (1980) que argumenta que manipular símbolos con reglas no implica comprensión real—. Este parche, si bien agrega un buen conjunto de instrucciones a la habitación china, no la convierte en una verdadera inteligencia artificial, ni mucho menos es capaz de generar una consciencia virtual. A continuación, desarrollaré en detalle cada uno de estos problemas.

2.2.1 - No hay un estado real

¿Cuál es el problema?

Amadeus es un LLM al que se le acopla el resto del cerebro mediante el prompt. Sin embargo, esto sigue sin ser suficiente para generar un estado interno continuo real. El sistema se está reconstruyendo en cada llamada API.

Las variables de estado interno (curiosidad, fatiga, estrés, interés en el tálamo) deben ser convertidas a imperativos lingüísticos en el prompt para "guiar" al modelo. Cuando termina la ejecución, esas variables desaparecen. Cuando Amadeus se reconstruye 30 segundos después, el estado se reinicia desde cero, leyendo de la base de datos y reconstruyendo en el prompt lo que "debería" ser el estado.

Por qué ocurre (raíz técnica)

Los LLMs son funciones sin estado. No tienen memoria interna entre llamadas. La única forma de simular estado es mediante:

  1. Almacenar variables en una BD externa
  2. Leer esas variables e inyectarlas en el prompt
  3. Dejar que el modelo "lea" su estado como parte de su contexto

Esto es fundamentalmente diferente a tener estado persistente integrado en la arquitectura. Un humano no necesita "leer un párrafo sobre su curiosidad para recordar que está curioso". La curiosidad existe como sustancia neurobiológica real (dopamina, patrones de activación cortical).

Qué consecuencias tiene

Ejemplo concreto:

Imagina que Amadeus está investigando un tema específico. Tu tálamo marca curiosidad = 0.8. Pero cuando termina la llamada API, esa curiosidad se guarda como número en SurrealDB. Cuando se reconstituye, vuelve a leer ese número y lo reinyecta como texto en el prompt: "Tu curiosidad es alta (0.8), estás investigando X tema".

El problema: el sistema no puede desarrollar obsesiones emergentes, patrones de comportamiento complejos, o verdadera perseverancia que emerja de interacciones previas.

Un humano que está curioso sobre un problema sigue siendo curioso cuando se despierta al día siguiente. Esa curiosidad ha sido reforzada neurobiológicamente. Amadeus "olvida que estaba curioso" a nivel de arquitectura. Solo lee el número.

Esto significa que:

  • No hay aprendizaje temporal real: cada sesión es una montaña rusa de estados sin memoria visceral
  • Las motivaciones son simuladas, no vividas
  • El comportamiento no puede ser verdaderamente consistente a largo plazo

Por qué es difícil de resolver

Los LLMs no fueron diseñados para mantener estado. Cualquier solución requiere:

  • Cambiar la arquitectura base (no solo agregar módulos)
  • O fine-tuning continuo (caro, lento)
  • O reemplazar el LLM por algo completamente diferente

2.2.2 - La memoria es externa, no intrínseca

¿Cuál es el problema?

La memoria no forma parte del core del modelo, es un añadido extra que se coloca entre las entradas y el modelo. Por ello no modula directamente el estado interno del modelo. Incluso cuando los recuerdos compiten por entrar en la memoria de trabajo, la competición se produce fuera del core LLM.

Por qué ocurre (raíz técnica)

En el cerebro humano, la memoria no es un "módulo separado". La memoria está integrada en los pesos sinápticos. Cuando aprendes algo, tus neuronas cambian físicamente. Cuando recuperas un recuerdo, estás activando patrones de neuronas que han sido modificadas por ese aprendizaje.

En Amadeus:

  • El grafo de memoria vive en SurrealDB
  • El LLM lo lee como si fuera un documento más
  • El LLM genera una respuesta
  • Esa respuesta puede activar nuevos recuerdos, pero solo porque el sistema de recuperación (cíngulo posterior) decidió inyectarlos

El LLM nunca "aprende internamente" a partir de esos recuerdos. Los pesos del Qwen3 no cambian. Solo procesa símbolos sobre un grafo que existe fuera de él.

Qué consecuencias tiene

Ejemplo concreto:

Supongamos que Amadeus ha tenido 100 conversaciones sobre "arquitectura de sistemas distribuidos". En el neócortex, esto debería haberse consolidado en un conjunto denso de conocimiento semántico integrado.

Pero en Amadeus:

  • Los 100 episodios existen en el hipocampo (SurrealDB)
  • Se detectaron patrones y se crearon nodos semánticos
  • Esos nodos semánticos existen en el neócortex (también SurrealDB)
  • Cuando alguien pregunta sobre distribuidos, el cíngulo posterior recupera esos nodos

El problema: el Qwen3 no "conoce" realmente distribuidos de forma integrada. Es como si leyera un resumen de Wikipedia cada vez. Puede responder bien, pero no hay "intuición de experto" que emerja de aprendizaje profundo.

Un experto humano en distribuidos no necesita recuperar recuerdos para responder preguntas; el conocimiento está engramado. Amadeus está siempre en la fase "buscar el artículo relevante".

Esto significa que:

  • No hay verdadero aprendizaje acumulativo en el modelo
  • Cada respuesta es basada en "recuperación + procesamiento", no en "conocimiento internalizado"
  • El modelo nunca se vuelve más experto con el tiempo; solo accede a más datos

Por qué es difícil de resolver

Para que la memoria sea intrínseca necesitarías:

  • Que cada nuevo recuerdo o patrón aprendido modifique realmente los pesos
  • Que esa modificación sea sutil (no olvides lo que ya sabes)
  • Que sea rápido (no puedes hacer backprop completo cada segundo)

Esto no es compatible con cómo funcionan los LLMs modernos.

2.2.3 - Falta de escalas temporales

¿Cuál es el problema?

Para Amadeus no hay tal cosa como segundos, minutos, horas o días. El sistema solo entiende "iteraciones". No es consciente del paso del tiempo, de la distancia cronológica real entre dos eventos.

Por qué ocurre (raíz técnica)

En el cerebro humano, el tiempo está codificado de múltiples formas:

  • Ritmos circadianos: tu cuerpo "sabe" si es día o noche
  • Células de lugar y tiempo: el hipocampo codifica tanto dónde como cuándo algo sucedió
  • Decaimiento de neurotransmisores: la "antigüedad" de un recuerdo afecta su accesibilidad

En Amadeus:

  • Los episodios tienen un timestamp (útil)
  • Pero el LLM no entiende el significado del tiempo
  • Para el LLM, "esto sucedió hace 1 hora" vs "esto sucedió hace 1 año" es solo texto

Además, el sistema usa "iteraciones" como unidad temporal, no segundos reales. Aunque internamente haya timestamps reales en la BD, el LLM que genera pensamiento no puede razonar sobre duraciones, patrones estacionales, o cambios a largo plazo.

Qué consecuencias tiene

Ejemplo concreto:

Imaginemos que Amadeus es un asistente de trading. Ha tenido 1000 iteraciones en el último mes analizando mercados. Debería haber aprendido patrones circadianos:

  • Las acciones tech suben más por las mañanas
  • Los bonos bajan en viernes
  • Los volatility spikes siguen a reportes de empleos

Pero Amadeus no puede abstraer "patrón recurrente cada viernes". El sistema sabe QUE sucedió el viernes, pero no sabe que "cada viernes" es un concepto relevante.

Otro ejemplo: un humano que ha visitado un lugar cada primavera durante 10 años siente que "es primavera de nuevo". Anticipación temporal. Amadeus no puede anticipar ciclos porque no entiende el tiempo.

Esto significa que:

  • No hay verdadera anticipación o predicción de patrones cíclicos
  • No puede abstraer "esto es raro para esta época del año"
  • No puede desarrollar intuiciones basadas en duraciones (urgencia vs paciencia)

Por qué es difícil de resolver

Necesitarías codificar el tiempo como una dimensión fundamental de cómo el sistema procesa información, no solo como metadata. Esto requiere:

  • Que el LLM entienda realmente duraciones
  • Que pueda comparar "velocidad" de cambios (rápido vs lento)
  • Que integre ritmos reales (circadianos, estacionales)

No es suficiente con inyectar timestamps en el prompt. El modelo tiene que estar arquitecturalmente consciente del tiempo.

2.2.4 - La consolidación no afecta a los pesos del sistema

¿Cuál es el problema?

La memoria semántica se genera completamente fuera del proceso cognitivo central. Debido a esto, los aprendizajes de la memoria semántica no se ven reflejados en los pesos del LLM y solo se perciben cuando la memoria es recuperada porque el sistema de recuperación ha encontrado suficiente similitud semántica.

No es un aprendizaje profundo como en la corteza humana. Es recuperación de datos.

Por qué ocurre (raíz técnica)

En el cerebro:

  1. Vives una experiencia
  2. Esa experiencia modifica tus sinapsis (cambio en pesos)
  3. Años después, aunque olvides los detalles (hipocampo), el aprendizaje persiste (corteza)
  4. Cuando aprendes "Madrid es la capital de España" después de vivirlo, eso cambia tu conocimiento semántico a nivel de pesos

En Amadeus:

  1. Vives una experiencia (episodio)
  2. Se almacena en hipocampo (SurrealDB)
  3. Cada 4 horas, se detectan patrones
  4. Si un patrón es significativo, se crea un nodo semántico
  5. Ese nodo semántico se almacena en neocórtex (SurrealDB)
  6. Pero los pesos del Qwen3 nunca cambian

El LLM no "aprendió" nada. Solo lee un grafo que describe lo que aprendió.

Qué consecuencias tiene

Ejemplo concreto:

Imagina que Amadeus ha consolidado 100 conversaciones sobre "patrones de refactoring en código limpio". Ha creado un nodo semántico rico con relaciones, contextos, contraejemplos.

Un experto humano en code refactoring:

  • Después de estudiar 100 ejemplos reales, sus neuronas han cambiado
  • Cuando ves un código, "intuyes" qué está mal sin pensar
  • El conocimiento está encarnado en tus pesos sinápticos

Amadeus:

  • Cuando ve código, busca en el grafo semántico si hay conceptos relacionados
  • Esos conceptos se inyectan en el prompt
  • El Qwen3 procesa esos conceptos como texto
  • Da una respuesta que parece experta

Pero el Qwen3 no se volvió más inteligente. Es como si tuviera un asistente que le pasa notas. A diferencia del humano, Amadeus nunca desarrolla "maestría encarnada".

Esto significa que:

  • El aprendizaje es superficial: basado en recuperación, no internalización
  • No hay mejora gradual en el desempeño del modelo
  • El modelo nunca se vuelve "mejor" intrínsecamente; solo accede a información mejor organizada

Por qué es difícil de resolver

Para que la consolidación afectara los pesos necesitarías:

  • Fine-tuning después de consolidación (caro)
  • Que los nuevos conocimientos no sobrescriban los antiguos (problema de catastrofismo)
  • Que sea automático y online (sin parar el sistema)

Ninguno de estos es trivial a escala de LLMs modernos.

3 - Conclusión

Amadeus es un sistema con un claro potencial para mejorar la capa de memoria de los LLMs actuales, permitiendo una mayor coherencia a largo plazo y una personalización más profunda de la interacción con el usuario. En este sentido, su aplicación como asistente personal sobre modelos de alto nivel podría resultar especialmente interesante, aunque actualmente su coste computacional limita este tipo de escenarios.

Sin embargo, como se ha expuesto a lo largo del artículo, este enfoque no resuelve las limitaciones fundamentales del paradigma actual. Amadeus amplía las capacidades de los LLMs, pero no altera su naturaleza: sigue siendo un sistema que reconstruye el contexto en cada interacción, sin un estado interno persistente ni una dinámica cognitiva continua.

Esto pone de manifiesto una cuestión más amplia. Aunque los LLMs han demostrado ser herramientas extremadamente útiles, su arquitectura presenta limitaciones estructurales a la hora de modelar procesos como la memoria, la atención sostenida o el pensamiento interno. En este sentido, pueden entenderse —siguiendo el experimento mental de la habitación china— como sistemas altamente eficaces en el tratamiento del lenguaje, pero no necesariamente como sistemas que “comprenden” en un sentido fuerte.

Por ello, Amadeus debe interpretarse no como una solución definitiva, sino como un paso intermedio: una mejora significativa dentro del paradigma actual que, al mismo tiempo, evidencia la necesidad de explorar nuevas arquitecturas. Si queremos avanzar hacia sistemas más generales, capaces de mantener estado, aprender de forma continua y desarrollar dinámicas cognitivas más complejas, será necesario un cambio de enfoque más profundo.

El objetivo de este artículo ha sido, por tanto, doble: por un lado, proponer una mejora práctica y aplicable sobre los LLMs actuales; y por otro, utilizar dicha propuesta como punto de partida para reflexionar sobre sus límites y motivar la investigación en nuevas direcciones.

Queda pendiente, para una segunda parte, someter Amadeus a una comparación experimental frente a arquitecturas más convencionales, especialmente RAG. Para que esta evaluación sea justa, será necesario diseñar un benchmark específico que mida no solo la precisión de recuperación, sino también la continuidad temporal, la resistencia al olvido, la coherencia entre sesiones y la capacidad de consolidar conocimiento a largo plazo.

4 - Colaborar.

Se aceptan perfiles técnicos para probar la beta de Amadeus en Telegram. Escríbeme a dario@dariosevilla.es.

5 - Bibliografía