-30% en todos los cursos con acceso anual | Usa el código de descuento SUMMERSALE

La verdadera historia de spaced repetitions

history

Dr. Piotr Wozniak, junio de 2018

Contenido

Introducción

La verdadera historia

La historia popular de la repetición espaciada está llena de mitos y falsedades. Este texto busca contar la historia verdadera. El problema de la repetición espaciada es que se volvió demasiado popular para su propia replicación efectiva. Como un virus de rápida mutación, va saltando de aplicación en aplicación, contando su propia historia mientras acumula errores en el camino.

¿Quién inventó la repetición espaciada?

Esta es la historia de cómo resolví el problema del olvido. Descubrí cómo aprender de forma eficiente. La modestia es una pérdida de tiempo, así que añadiré que creo que en realidad sé cómo amplificar significativamente la inteligencia humana. En pocas palabras: la memoria sustenta el conocimiento, que a su vez sustenta la inteligencia. Si podemos controlar qué almacenamos en la memoria y qué olvidamos, podemos controlar nuestra capacidad de resolver problemas. De forma muy similar, también podemos amplificar la inteligencia artificial. Es un gran alivio poder escribir estas palabras con orgullo después de muchos años de una mordaza impuesta por consideraciones comerciales.

A comienzos de la década de 1990, pensaba que sabía cómo poner patas arriba los sistemas educativos de todo el mundo y hacer que funcionaran para todos los estudiantes. Sin embargo, cualquier cambio importante requiere un giro de paradigma cultural. No basta con que un estudiante pobre de un país comunista pobre anuncie el potencial de un cambio. Yo lo hice, en mi tesis de maestría, pero encontré poco interés en mis ideas. Incluso mi propia familia se mostró indiferente. Por suerte, conocí a algunos amigos inteligentes en mi universidad que declararon que usarían mis ideas para montar un negocio. Así como Microsoft cambió el mundo de la computación personal, nosotros cambiaríamos la forma en que la gente aprende. Teníamos una poderosa herramienta de aprendizaje: SuperMemo. Sin embargo, para que SuperMemo conquistara el mundo, tuvo que abandonar sus raíces por un tiempo. Para convencer a los demás, SuperMemo tenía que ser un producto de ciencia pura. No podía ser simplemente una idea concebida por un humilde estudiante.

Para arraigar a SuperMemo en la ciencia, hicimos un gran esfuerzo por publicar nuestras ideas en una revista revisada por pares, adoptamos un término científico poco conocido, » repetición espaciada «, y situamos nuestra tecnología de aprendizaje en el contexto de la teoría del aprendizaje y la historia de la investigación en psicología. Soy muy escéptico respecto de las escuelas, los certificados y los títulos. Sin embargo, llegué incluso a obtener un doctorado en economía del aprendizaje, para dar respetabilidad a mis palabras.

Hoy, cuando la repetición espaciada finalmente aparece en cientos de herramientas de aprendizaje, aplicaciones y servicios respetables, por fin podemos reclamar el mérito y plantar la bandera en la cima. El número de usuarios se acerca a los cientos de millones.

Si lees SuperMemopedia aquí podrías concluir que «nadie debería atribuirse el mérito de haber descubierto la repetición espaciada». Yo discrepo. En este texto reclamaré todo el mérito del descubrimiento, y un mérito considerable por la difusión de la idea. Mi aporte a esto último se ha ido reduciendo gracias al poder de la propia idea y a un círculo creciente de personas involucradas en el concepto (mucho más allá de nuestra empresa).

Perpetuando mitos

Es Krzysztof Biedalak (CEO) quien tiene menos paciencia con las noticias falsas relacionadas con la repetición espaciada. Le atribuiré entonces este texto en particular y el esfuerzo de desmentir mitos a su determinación de mantener la historia en orden. SuperMemo para DOS nació hace 30 años (1987). Rindamos algo de tributo.

Si crees que Ebbinghaus inventó la repetición espaciada en 1885, te pido disculpas. Al compilar la historia de SuperMemo, pusimos el nombre del venerable psicólogo alemán en lo más alto de la lista cronológica y así nació el mito. Ebbinghaus nunca trabajó sobre la repetición espaciada.

Escribir sobre la historia de la repetición espaciada no es fácil. Cada vez que lo hacemos, generamos más mitos por distorsiones y malentendidos. Dejémoslo claro y enfático entonces. Ha habido una gran cantidad de investigación sobre la memoria antes de SuperMemo. Sin embargo, cada vez que reparto mérito con generosidad, ten presentes las palabras de Biedalak:

Si SuperMemo es un transbordador espacial, hay que reconocer el trabajo previo hecho con bicicletas. Mientras tanto, nuestra competencia está ocupada tratando de replicar nuestro transbordador, pero los esfuerzos recuerdan al programa soviético Buran. El Buran al menos hizo un vuelo espacial. No tripulado

Este texto pretende poner los hechos en claro y revelar abiertamente los primeros pasos de la repetición espaciada. Es una incursión divertida en el pasado que me produce una satisfacción particular con la sensación de «misión cumplida». Ahora que podemos llamar a nuestro esfuerzo un éxito global, no hace falta hacerlo parecer más respetable de lo que realmente es. No hace falta hacerlo más científico, más histórico ni más certificado.

La repetición espaciada está aquí y llegó para quedarse. ¡Lo logramos!

Créditos

La lista de contribuyentes a la idea de la repetición espaciada es demasiado larga para incluirla en este breve artículo. Algunos nombres no aparecen porque simplemente se me acabó el tiempo asignado para describir sus aportes. El Dr. Phil Pavlik probablemente tuvo las ideas más frescas en este campo. Toda una serie de investigadores de la memoria estudian el impacto del espaciamiento en la memoria. Duolingo y Quizlet son competidores líderes con un impacto poderoso en la buena promoción de la idea. No logré incluir a muchos de mis fantásticos profesores que inspiraron mi forma de pensar. Todo el conjunto de personas trabajadoras y talentosas de SuperMemo World también merecería una mención. Los usuarios de SuperMemo aportan constantemente sugerencias increíbles que impulsan más progreso. El premio a la explicación de mayor impacto sobre la repetición espaciada debería ir a Gary Wolf de Wired, pero hubo muchos más. Quizás algún otro día tenga más tiempo para escribir en detalle sobre toda esa gente extraordinaria.

1985: Nacimiento de SuperMemo

El impulso por aprender mejor

Pasé 22 largos años en el sistema educativo. Las viejas verdades sobre la escolarización encajan perfectamente en mi caso. Nunca me gustó la escuela, pero siempre me gustó aprenderNunca dejé que la escuela interfiriera con mi aprendizaje. Al entrar a la universidad, tras 12 años en el sistema escolar público, todavía amaba aprender. La escolarización no destruyó ese amor por dos razones principales: (1) el sistema fue indulgente conmigo, y (2) tenía plena libertad para aprender lo que me gustaba en casa. En la Polonia comunista, nunca experimenté realmente el látigo tóxico de una escolarización severa. El sistema era negligente y yo adoraba las libertades resultantes.

Todos sabemos que el mejor aprendizaje viene de la pasión. Está impulsado por el impulso de aprender. Mi impulso de aprender era fuerte y estaba mezclado con algo de frustración. Cuanto más aprendía, más podía ver el poder del olvido. No podía remediar el olvido aprendiendo más. Mi memoria no era mala en comparación con la de otros estudiantes, pero claramente era un recipiente con fugas.

En 1982, presté más atención a algo que la mayoría de los estudiantes descubre tarde o temprano: el efecto de la prueba. Comencé a formular mi conocimiento para el recuerdo activo. Escribía preguntas en el lado izquierdo de una página y respuestas en una columna separada a la derecha:

De esta forma, podía tapar las respuestas con una hoja de papel y emplear el recuerdo activo para obtener un mejor efecto de memoria del repaso. Era un proceso lento, pero la eficiencia del aprendizaje aumentó drásticamente. Mis cuadernos de esa época están descritos como «material de asimilación rápida», en referencia a la forma en que se escribía mi conocimiento.

Entre 1982 y 1983, seguí ampliando mi conocimiento de «asimilación rápida» en las áreas de bioquímica e inglés. Repasaba mis páginas de información de vez en cuando para reducir el olvido. Mi retención mejoró, pero era solo cuestión de tiempo antes de volver a chocar contra la pared. Cuantas más páginas tenía, menos frecuente era el repaso, más evidente se hacía el problema de la memoria con fugas. He aquí un ejemplo de un historial de repeticiones de esa época:

Entre junio de 1982 y diciembre de 1984, mi cuaderno de pares de palabras inglés-polaco llegó a tener 79 páginas con este aspecto:

Figura: Una página típica de mi cuaderno de palabras inglés-polaco iniciado en junio de 1982. Los pares de palabras se listaban a la izquierda. El historial de repaso se registraba a la derecha. Los errores de recuerdo se marcaban como puntos en el medio

Esas 79 páginas abarcaban apenas 2794 palabras. Era solo una fracción de lo que necesitaba, y ya suponía un buen dolor de cabeza para repasar. Curiosamente, empecé a aprender inglés de forma activa, es decir, usando pares de palabras polaco-inglés, recién en 1984, con dos años de retraso. Simplemente tardé en descubrir que el conocimiento pasivo del vocabulario está bien para leer, pero no basta para hablar un idioma. Este tipo de ignorancia tras 6 años de escolarización es la norma. Las escuelas hacen mucho ejercicio repetitivo, pero arrojan muy poca luz sobre lo que hace que el aprendizaje sea eficiente.

A fines de 1984, decidí mejorar el proceso de repaso y llevar a cabo un experimento que cambió mi vida. Al final, tres décadas después, estoy muy orgulloso de notar que en realidad afectó a millones de personas. Abrió las compuertas. Vivimos una era de aprendizaje más rápido y mejor.

Así se describió este período inicial en mi tesis de maestría de 1990:

Aviso de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

Fue en 1982 cuando hice mis primeras observaciones sobre el mecanismo de la memoria que luego se usarían en la formulación del método SuperMemo. Como entonces estudiante de biología molecular, me sentía abrumado por la cantidad de conocimiento requerido para aprobar exámenes de matemáticas, física, química, biología, etc. El problema no era ser incapaz de dominar el conocimiento. Normalmente bastaban 2-3 días de estudio intensivo para llenar la cabeza con los datos necesarios para aprobar un examen. Lo frustrante era que solo una fracción infinitesimal de la sabiduría recién adquirida podía permanecer en la memoria pasados unos meses del examen.

Mi primera observación, obvia para cualquier estudiante atento, fue que uno de los elementos clave del aprendizaje era el recuerdo activo. Esta observación implica que la lectura pasiva de libros no es suficiente si no va seguida de un intento de recordar los hechos aprendidos desde la memoria. El principio de basar el proceso de aprendizaje en el recuerdo se denominará más adelante el principio del recuerdo activo. El proceso de recordar es mucho más rápido y no menos efectivo si las preguntas que se hace el estudiante son específicas en lugar de generales. Esto se debe a que las respuestas a preguntas generales contienen información redundante necesaria para describir las relaciones entre los subcomponentes de la respuesta.

Para ilustrar el problema, imaginemos una situación extrema en la que un estudiante quiere dominar el conocimiento contenido en cierto libro de texto y usa una sola pregunta en el proceso de recuerdo: ¿Qué aprendiste del libro de texto? Es obvio que la información que describe la secuencia de los capítulos del libro sería útil para responder la pregunta, pero es ciertamente redundante para lo que el estudiante realmente quiere saber. El principio de basar el proceso de recuerdo en preguntas específicas se denominará más adelante el principio de información mínima . Este principio parece justificado no solo por la eliminación de la redundancia.

Teniendo en mente los principios del recuerdo activo y de la información mínima, creé mis primeras bases de datos (es decir, colecciones de preguntas y respuestas) usadas en un intento de retener en la memoria el conocimiento adquirido. En aquel entonces, las bases de datos se guardaban en forma escrita en papel. Mi primera base de datos comenzó el 6 de junio de 1982 y estaba compuesta por páginas que contenían unos 40 pares de palabras cada una. La primera palabra de un par (interpretada como pregunta) era un término en inglés, la segunda (interpretada como respuesta) era su equivalente en polaco. Me referiré a estos pares como elementos.Repetía páginas concretas de la base de datos en intervalos irregulares (dependientes sobre todo de la disponibilidad de tiempo), registrando siempre la fecha de la repetición, los elementos que no se recordaban y su número. Esta manera de mantener el conocimiento adquirido en la memoria resultó suficiente para una base de datos de tamaño moderado, siempre que las repeticiones se realizaran con la frecuencia suficiente.

El cumpleaños de la repetición espaciada: 31 de julio de 1985

Intuiciones

En 1984, mi razonamiento sobre la memoria se basaba en dos intuiciones simples que probablemente tienen todos los estudiantes:

  • si repasamos algo dos veces, lo recordamos mejor. Es bastante obvio, ¿no? Si lo repasamos 3 veces, probablemente lo recordemos aún mejor
  • si recordamos un conjunto de notas, irán desapareciendo gradualmente de la memoria, es decir, no todas de golpe. Esto es fácil de observar en la vida. Los recuerdos tienen diferentes vidas útiles

Estas dos intuiciones deberían hacer que cualquiera se pregunte: ¿qué tan rápido y cuántas notas perdemos, y cuándo deberíamos repasar de nuevo?

Hasta el día de hoy, me sorprende que muy poca gente se haya molestado en medir ese » intervalo óptimo«. Cuando yo mismo lo medí, estaba seguro de que encontraría resultados más precisos en libros de psicología. No fue así.

Experimento

El siguiente experimento sencillo dio origen a la repetición espaciada. Se llevó a cabo en 1985 y se describió por primera vez en mi tesis de maestría de 1990. Se usó para establecer los intervalos óptimos para las primeras 5 repeticiones de páginas de conocimiento. Cada página contenía unos 40 pares de palabras, y el intervalo óptimo debía aproximar el momento en el tiempo en que se olvidaba aproximadamente entre un 5% y un 10% de ese conocimiento. Naturalmente, los intervalos estarían muy ajustados a ese tipo particular de material de aprendizaje y a una persona específica, en este caso, yo. Además, para acelerar las cosas, las muestras de medición eran pequeñas. Cabe notar que esto no era un proyecto de investigación. No estaba destinado a publicación. El objetivo era simplemente acelerar mi propio aprendizaje. Estaba convencido de que alguien más debía haber medido los intervalos mucho mejor, pero 13 años antes del nacimiento de Google, pensé que medir los intervalos sería más rápido que rebuscar en bibliotecas para encontrar mejores datos. El experimento terminó el 24 de agosto de 1985, fecha que originalmente llamé el cumpleaños de la repetición espaciada. Sin embargo, al escribir este texto en 2018, encontré los materiales de aprendizaje originales, y parece que mis ganas de aprender me llevaron a formular un esbozo de un algoritmo y comenzar a aprender biología humana el 31 de julio de 1985.

Por esa razón, puedo decir que el cumpleaños más preciso de SuperMemo y de la repetición espaciada computacional fue el 31 de julio de 1985.

Para el 31 de julio, antes de que terminara el experimento, los resultados ya parecían bastante predecibles. En años posteriores, los hallazgos de este experimento en particular resultaron bastante universales y pudieron extenderse a más áreas de conocimiento y a toda la población adulta sana. Incluso en 2018, la configuración predeterminada del Algoritmo SM-17 no se aparta mucho de esos hallazgos rudimentarios.

La repetición espaciada nació el 31 de julio de 1985

Aquí está la descripción original del experimento tomada de mi tesis de maestría con correcciones menores de gramática y estilo. El énfasis en el texto se añadió en 2018 para resaltar las partes importantes. Si parece aburrido e ilegible, compárese con Ebbinghaus 1885. Es el mismo estilo de escritura en el ámbito de la memoria. Solo los objetivos diferían. Ebbinghaus trataba de entender la memoria. 100 años después, yo solo quería aprender más rápido:

Aviso de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

Experimento destinado a aproximar la duración de los intervalos óptimos entre repeticiones (25 de febrero de 1985 – 24 de agosto de 1985):

  1. El experimento constaba de las etapas A, B, C, … etc. Cada una de estas etapas tenía como objetivo calcular el segundo, tercer, cuarto y siguientes intervalos cuasi óptimos entre repeticiones (el primer intervalo se fijó en un día, ya que parecía el más adecuado a juzgar por los datos recopilados con anterioridad). El criterio para establecer los intervalos cuasi óptimos era que fueran lo más largos posible y permitieran no más de un 5% de pérdida del conocimiento recordado.
  2. El conocimiento memorizado en cada una de las etapas A, B, C consistía en 5 páginas que contenían unos 40 elementos con la siguiente forma:Pregunta: palabra en inglés,Respuesta: su equivalente en polaco.
  3. Cada una de las páginas usadas en una etapa dada se memorizaba en una sola sesión y se repetía al día siguiente. Para evitar confusiones, nótese que, para simplificar las consideraciones posteriores, uso el término primera repetición para referirme a la memorización de un elemento o grupo de elementos. Al fin y al cabo, ambos procesos, memorización y reaprendizaje, tienen la misma forma: responder preguntas hasta que el número de errores llegue a cero.
  4. En la etapa A (25 de febrero – 16 de marzo), la tercera repetición se hizo en intervalos de 2, 4, 6, 8 y 10 días para cada una de las cinco páginas respectivamente. La pérdida de conocimiento observada tras estas repeticiones fue de 0, 0, 0, 1 y 17 por ciento respectivamente. Se eligió el intervalo de siete días para aproximar el segundo intervalo cuasi óptimo entre repeticiones, separando la segunda y la tercera repetición.
  5. En la etapa B (20 de marzo – 13 de abril), la tercera repetición se hizo tras intervalos de siete días, mientras que las cuartas repeticiones siguieron a los 6, 8, 11, 13 y 16 días para cada una de las cinco páginas respectivamente. La pérdida de conocimiento observada ascendió a 3, 0, 0, 0 y 1 por ciento. Se eligió el intervalo de 16 días para aproximar el tercer intervalo cuasi óptimo. Nota: habría sido científicamente más válido repetir la etapa B con variantes más largas del tercer intervalo, porque la pérdida de conocimiento fue escasa incluso con los intervalos más largos elegidos; sin embargo, entonces tenía demasiadas ganas de ver los resultados de los siguientes pasos como para dedicar tiempo a repetir la etapa B, que ya parecía suficientemente exitosa (es decir, había dado buena retención)
  6. En la etapa C (20 de abril – 21 de junio), las terceras repeticiones se hicieron tras intervalos de siete días, las cuartas repeticiones tras intervalos de 16 días y las quintas repeticiones tras intervalos de 20, 24, 28, 33 y 38 días. La pérdida de conocimiento observada fue de 0, 3, 5, 3 y 0 por ciento. La etapa C se repitió con intervalos más largos previos a la quinta repetición (31 de mayo – 24 de agosto). Los intervalos y las pérdidas de memoria fueron los siguientes: 32-8%, 35-8%, 39-17%, 44-20%, 51-5% y 60-20%. Se eligió el intervalo de 35 días para aproximar el cuarto intervalo cuasi óptimo.

No es difícil notar que cada una de las etapas del experimento descrito tomó aproximadamente el doble de tiempo que la anterior. Podrían pasar varios años para establecer los primeros diez intervalos cuasi óptimos entre repeticiones. De hecho, continué experimentos de este tipo en los años siguientes para obtener una comprensión más profunda del proceso de espaciar de forma óptima las repeticiones del conocimiento memorizado. Sin embargo, en aquel momento, decidí emplear los hallazgos en mi proceso rutinario de aprendizaje diario.

El 31 de julio de 1985, ya podía intuir el resultado del experimento. Empecé a usar SuperMemo en papel para aprender biología humana. Esa sería la mejor fecha para llamarla el cumpleaños de SuperMemo.

Los sucesos del 31 de julio de 1985

El 31 de julio de 1985 nació SuperMemo. Ya disponía de la mayoría de los datos de mi experimento de repetición espaciada. Como ávido practicante, no esperé a que terminara el experimento. Quería empezar a aprender lo antes posible. Habiendo acumulado una gran cantidad de notas de biología humana, empecé a convertirlas al formato Special Memorization Test (SMT era el nombre original de SuperMemo, y de la repetición espaciada).

Figura: Biología humana en el formato Special Memorization Test iniciado el 31 de julio de 1985 (es decir, el nacimiento de SuperMemo)

Mis cálculos me indicaban que, a 20 min/día, necesitaría 537 días para procesar mis notas y terminar el trabajo hacia enero de 1987. También calculé que cada página de la prueba probablemente me costaría 2 horas de vida. A pesar de toda la promesa y velocidad de SuperMemo, esta constatación fue bastante dolorosa. La velocidad del aprendizaje en la universidad es demasiado rápida para la capacidad de la memoria humana. Ahora que podía aprender mucho más rápido y mejor, también me di cuenta de que no llegaría a cubrir ni una fracción de lo que pensaba que era posible. Las escuelas no tienen ningún sentido con su volumen y velocidad. Ese mismo día, me enteré de que el gobierno comunista polaco había levantado los aranceles de importación de microordenadores. Esto haría posible, en algún momento, comprar un ordenador en Polonia. Esto abrió el camino hacia SuperMemo para DOS 2 años y medio después.

También el 31 de julio anoté que, si las vacaciones pudieran durar para siempre, lograría mucho más en el aprendizaje e incluso más en la vida. La escuela es tal pérdida de tiempo. Sin embargo, la amenaza del servicio militar obligatorio me mantuvo a raya. Entraría en un camino que me haría matricularme en la universidad por otros 5 años. Sin embargo, la mayor parte de ese tiempo se dedicó a SuperMemo y tengo pocos arrepentimientos.

Mi experimento de repetición espaciada terminó el 24 de agosto de 1985. También empecé a aprender vocabulario de inglés. Para ese día, ya había logrado tener la mayor parte de mi material de bioquímica escrito en páginas para repasar con SuperMemo.

Nota: Mi tesis de maestría menciona erróneamente el 1 de octubre de 1985 como el día en que empecé a aprender biología humana (no el 31 de julio, como se ve en la imagen anterior). El 1 de octubre de 1985 fue en realidad el primer día de mi universidad de informática y, por lo demás, fue un día sin nada destacable. Con el comienzo de la universidad, mi tiempo para aprender y mi energía para aprender se redujeron drásticamente. Paradójicamente, el comienzo de la escuela siempre parece augurar el fin del buen aprendizaje.

Primer algoritmo de repetición espaciada: Algoritmo SM-0, 25 de agosto de 1985

Como resultado de mi experimento de repetición espaciada, pude formular el primer algoritmo de repetición espaciada que no requería un ordenador. Todo el aprendizaje debía hacerse en papel. No tenía un ordenador en 1985. Recién en 1986 conseguiría mi primer microordenador, el ZX Spectrum. SuperMemo tendría que esperar al primer ordenador con una unidad de disquete (Amstrad PC 1512 en el año 1987).

A menudo me hacen esta pregunta simple: «¿Cómo puedes formular SuperMemo después de un experimento que duró 6 meses? ¿Cómo puedes predecir lo que pasaría en 20 años?»

Los primeros experimentos en relación con la duración del intervalo óptimo resultaron en conclusiones que permitieron predecir la duración más probable de los intervalos sucesivos entre repeticiones ¡sin siquiera medir la retención más allá de unas semanas! En resumen, podría ilustrarse con el siguiente razonamiento. Si los primeros meses de investigación arrojaron los siguientes intervalos óptimos: 1, 2, 4, 8, 16 y 32 días, se podría esperar con confianza que los intervalos sucesivos aumentaran por un factor de dos.

Aviso de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

Algoritmo SM-0 usado en la repetición espaciada sin ordenador (25 de agosto de 1985)

  1. Dividir el conocimiento en los elementos de pregunta-respuesta más pequeños posibles
  2. Asociar los elementos en grupos que contengan entre 20 y 40 elementos. Estos grupos se llamarán más adelante páginas
  3. Repetir páginas completas usando los siguientes intervalos (en días):I(1)=1 díaI(2)=7 díasI(3)=16 díasI(4)=35 díaspara i>4: I(i):=I(i-1)*2donde:
    • I(i) es el intervalo usado después de la i-ésima repetición
  4. Copiar todos los elementos olvidados tras el intervalo del día 35 en páginas recién creadas (sin eliminarlos de las páginas usadas anteriormente). Esas páginas nuevas se repetirán de la misma manera que las páginas con elementos aprendidos por primera vez

Nótese que se asumió que los intervalos entre repeticiones tras la quinta repetición se duplicarían en las repeticiones subsiguientes. Este hecho se basó en una intuición más que en un experimento. En dos años de usar el Algoritmo SM-0 se recopilaron suficientes datos para confirmar una precisión razonable de esta suposición.

Hasta el día de hoy, oigo que algunas personas usan o incluso prefieren la versión en papel de SuperMemo. Aquí hay una descripción de 1992.

Nótese que la intuición de que los intervalos deberían duplicarse es tan antigua como la teoría del aprendizaje. En 1932, C. A. Mace insinuó los métodos de aprendizaje eficientes en su libro » The psychology of study«. Mencionó el » ensayo activo» y las » revisiones repetitivas» que debían espaciarse en intervalos gradualmente crecientes, más o menos » intervalos de un día, dos días, cuatro días, ocho días, y así sucesivamente«. Esta propuesta fue retomada más tarde por otros autores. Entre ellos, Paul Pimsleur y Tony Buzan, quienes propusieron sus propias intuiciones que implicaban intervalos muy cortos (en minutos) o una «repetición final» (tras unos meses). Todas esas ideas no permearon bien la práctica del estudio más allá de las élites del aprendizaje. Solo una aplicación informática hizo posible empezar a aprender de forma efectiva sin estudiar la metodología.

Ese factor intuitivo de multiplicación de intervalos de 2 también apareció en el contexto del estudio de la posibilidad de optimización evolutiva de la memoria en respuesta a las propiedades estadísticas del entorno: » La memoria está optimizada para satisfacer las propiedades probabilísticas del entorno «

A pesar de toda su simplicidad, en mi tesis de maestría, no dudé en llamar a mi nuevo método «revolucionario»:

Aviso de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

Aunque la tasa de adquisición no pareciera asombrosa, el Algoritmo SM-0 fue revolucionario en comparación con mis métodos anteriores por dos razones:

  • con el paso del tiempo, la retención del conocimiento aumentaba en lugar de disminuir (como ocurría con el aprendizaje intermitente)
  • en una perspectiva a largo plazo, la tasa de adquisición permanecía casi sin cambios (con el aprendizaje intermitente, la tasa de adquisición declinaría sustancialmente con el tiempo)

[…]

Por primera vez, pude conciliar una alta retención de conocimiento con repeticiones poco frecuentes, lo que en consecuencia llevó a un volumen de conocimiento recordado que aumentaba de forma constante ¡sin necesidad de incrementar la carga de tiempo!

Se logró fácilmente una retención del 80%, que incluso podía aumentarse acortando los intervalos entre repeticiones. Esto, sin embargo, implicaría repeticiones más frecuentes y, en consecuencia, un aumento de la carga de tiempo. El espaciamiento de repeticiones asumido ofrecía un compromiso satisfactorio entre retención y carga de trabajo.

[…]La siguiente mejora significativa del Algoritmo SM-0 llegaría recién en 1987, tras la aplicación de un ordenador para supervisar el proceso de aprendizaje. Mientras tanto, acumulé unos 7190 y 2817 elementos en mis nuevas bases de datos de inglés y biología respectivamente. Con un tiempo de trabajo estimado de 12 minutos al día para cada base de datos, la tasa media de adquisición de conocimiento ascendió a 260 y 110 elementos/año/minuto respectivamente, mientras que la retención de conocimiento fue del 80% en el peor de los casos.

El nacimiento de SuperMemo desde la perspectiva de una década

Una década después del nacimiento de SuperMemo, se volvió bastante conocido en Polonia. Aquí está la misma historia narrada de nuevo por J. Kowalski, Enter, 1994:

Era 1982, cuando un estudiante de 20 años de biología molecular en la Universidad Adam Mickiewicz de Poznan, Piotr Wozniak, se sentía bastante frustrado por su incapacidad de retener en el cerebro los conocimientos recién aprendidos. Esto se refería al vasto material de bioquímica, fisiología, química e inglés que uno debía dominar si deseaba emprender una carrera exitosa en biología molecular. Uno de los principales incentivos para abordar el problema del olvido de manera más sistemática fue un simple cálculo hecho por Wozniak, que le mostró que, si seguía trabajando para dominar el inglés con sus métodos habituales, necesitaría 120 años para adquirir todo el vocabulario importante. Esto no solo llevó a Wozniak a trabajar en métodos de aprendizaje, sino que también lo convirtió en un firme defensor de la idea de un solo idioma para toda la humanidad (teniendo en cuenta el tiempo y el dinero que la humanidad gasta en traducción y en aprender idiomas). Al principio, Wozniak fue acumulando cada vez más pilas de notas con datos y cifras que quería recordar. No tardó en descubrir que el olvido requiere repeticiones frecuentes y que se necesita un enfoque sistemático para gestionar todo el conocimiento recién recopilado y memorizado. Usando una intuición obvia, Wozniak intentó medir la retención del conocimiento tras diferentes intervalos entre repeticiones, y en 1985 formuló el primer esbozo de SuperMemo, que todavía no requería un ordenador. Para 1987, Wozniak, entonces estudiante de segundo año de informática, estaba bastante asombrado con la eficacia de su método y decidió implementarlo como un sencillo programa de ordenador. La eficacia del programa resultó ir mucho más allá de lo que había esperado. Esto desencadenó un emocionante intercambio científico entre Wozniak y sus colegas de la Universidad Politécnica de Poznan y la Universidad Adam Mickiewicz. Una docena de estudiantes de su departamento asumieron el papel de conejillos de indias y memorizaron miles de elementos, proporcionando un flujo constante de datos y comentarios críticos. El Dr. Gorzelańczyk, de la Academia Médica, ayudó a formular el modelo molecular de formación de la memoria y a modelar los fenómenos que ocurren en la sinapsis. El Dr. Makałowski, del Departamento de Bioquímica de Biopolímeros, contribuyó al análisis de los aspectos evolutivos de la optimización de la memoria (nota: también fue quien sugirió registrar SuperMemo como Software para Europa). Janusz Murakowski, licenciado en física, actualmente inscrito en un programa de doctorado en la Universidad de Delaware, ayudó a Wozniak a resolver problemas matemáticos relacionados con el modelo de aprendizaje intermitente y la simulación de corrientes iónicas durante la transmisión del potencial de acción en las células nerviosas. Una docena de futuros profesores universitarios, con el Prof. Zbigniew Kierzkowski a la cabeza, ayudaron a Wozniak a orientar su programa de estudios hacia un objetivo: combinar todos los aspectos de SuperMemo en una teoría coherente que abarcara los aspectos moleculares, evolutivos, conductuales, psicológicos e incluso sociales de SuperMemo. Wozniak, que afirma haber descubierto al menos varias propiedades de la memoria importantes y nunca publicadas, pretendía consolidar sus teorías obteniendo un doctorado en neurociencia en Estados Unidos. Muchas horas de conversación con Krzysztof Biedalak, licenciado en informática, hicieron que ambos eligieran otro camino: intentar cumplir la visión de llevar SuperMemo a estudiantes de todo el mundo.

1986: Primeros pasos de SuperMemo

SuperMemo en papel

El 22 de febrero de 1984, calculé que, a mi ritmo de aprendizaje y con mi inversión en el aprendizaje, me tomaría 26 años dominar el inglés (en SuperMemo, el estándar de Advanced English son 4 años a 40 min/día). Con la llegada de SuperMemo en papel, esa estadística mejoró drásticamente.

En el verano de 1985, usando SuperMemo en papel, empecé a aprender con gran entusiasmo. Por primera vez, sabía que toda inversión en el aprendizaje daría frutos. Nada podía escapárseme. Este entusiasmo inicial me hace preguntarme por qué no compartí mis buenas noticias con otros.

SuperMemo no era un «arma secreta» que muchos usuarios emplean para impresionar a otros. Simplemente pensaba que la ciencia debía haber respondido ya todas las preguntas relacionadas con el aprendizaje eficiente. Mi impresión era que solo estaba parchando mi propio acceso limitado a la literatura occidental con un poco de investigación propia. Mi ingenuidad de aquella época era astronómica. Mi inglés no era lo bastante bueno como para entender las noticias de occidente. Para mí, Estados Unidos era una tierra de superhumanos que hacen superciencia, aterrizan en la luna, hacen todos los grandes descubrimientos y pronto curarán el cáncer y se harán inmortales. Al mismo tiempo, era la tierra de Reagan, que podía borrar a Polonia de la faz de la Tierra con misiles Pershing o de crucero. Eso me dio un par de pesadillas. Quizás la única fuente importante de estrés a comienzos de los años 80. A menudo reflexiono sobre las asombrosas inconsistencias en los cerebros de los niños pequeños o adolescentes. Para mí, la ingenuidad de mis primeros veinte años me dice que debí haber sido de maduración tardía, con un desarrollo muy desigual. La ignorancia del inglés se traducía en ignorancia del mundo. Era un joven adulto con áreas de fortaleza y áreas de increíble ignorancia. En ese contexto, la repetición espaciada parece hija de una necesidad combinada con ignorancia, confianza en uno mismo y pasión.

Universidad

En octubre de 1985, comencé mis años en una universidad de informática. Perdí la pasión por la universidad en la primera semana de clases. En lugar de programación, estábamos sometidos a clases insoportablemente aburridas de temas introductorios de matemáticas, física, electrónica, etc. Con una agenda tan ocupada, podría haber abandonado SuperMemo fácilmente. Por suerte, mi amor por la bioquímica y mi necesidad de inglés no me dejaron aflojar el ritmo. Continué mis repeticiones, añadiendo nuevas páginas de vez en cuando. Sobre todo, tenía un nuevo sueño: tener mi propio ordenador y hacer algo de programación por mi cuenta. Una de las primeras cosas que quise implementar fue SuperMemo. Guardaría mis páginas en el ordenador y las programaría automáticamente.

Mencioné casualmente mi método de superaprendizaje a mi amigo de la secundaria Andrzej «Mike» Kubiak recién en el verano de 1987 (29 de agosto). Jugábamos fútbol y hacíamos música juntos. Finalmente le mostré cómo usar SuperMemo el 14 de noviembre de 1987. Me llevó 836 días (2 años, 3 meses y 2 semanas) reclutar al primer usuario de SuperMemo. Mike fue después mi conejillo de indias probando SuperMemo en el aprendizaje procedimental. Siguió practicando ritmos generados por ordenador usando un calendario tipo SuperMemo. Para Mike, SuperMemo fue amor a primera vista. Su vocabulario se disparó. Se mantuvo fiel durante muchos años, hasta un punto en que la calidad de su inglés superó la necesidad de seguir aprendiendo. Es yogui, y su viaje a la India y el uso regular del inglés han consolidado el conocimiento necesario para toda la vida.

ZX Spectrum

En 1986 y 1987, pensaba cada vez más en SuperMemo en un ordenador. Curiosamente, al principio no pensé mucho en el problema de separar las páginas en tarjetas individuales. Esto ilustra lo cerrados de mente que podemos volvernos cuando caemos en la rutina de hacer las mismas cosas a diario. Para llegar al estado de 2018, SuperMemo tuvo que atravesar decenas de avances y microetapas igualmente obvias. Todo parece muy simple y obvio en retrospectiva. Sin embargo, existen límites ocultos del pensamiento humano que impidieron que la lectura incremental surgiera una década antes. Solo una fracción de esos límites está en la tecnología.

En mi primer año de universidad tenía muy poco tiempo y energía disponibles, y la mayor parte de ese tiempo lo invertí en conseguir mi primer ordenador: un ZX Spectrum (enero de 1986). Pedí prestado uno a un amigo por un día en otoño de 1985 y quedé totalmente deslumbrado. Empecé a programar «en papel» mucho antes de conseguir el juguete. Mi primer programa fue «planificar el día», precursor de Plan. El programa estaba listo para escribirlo en el ordenador cuando encendí mi ZX Spectrum por primera vez el 4 de enero de 1986. A partir de ese día, pasé la mayoría de mis días programando, ignorando la escuela y escribiendo mis programas en papel incluso durante las clases.

Figura: Ordenador personal doméstico de 8 bits ZX Spectrum.

El ejército

A comienzos de 1986 me atormentaba la amenaza del servicio militar obligatorio. Pensaba que 5 años más de universidad significaban 5 años más de libertad. Sin embargo, el ejército tenía otras ideas. Para ellos, una segunda carrera no contaba, y tuve que hacer malabares para evitar el servicio. Mi enojo se triplicó por el hecho de que jamás contemplaría 12 meses de separación de mi mejor nuevo amigo: el ZX Spectrum. Le dije al hombre de uniforme que realmente no querían tener a un hombre enojado con un arma en sus filas. Por suerte, en el caos de la burocracia comunista, logré escabullirme y continuar mi educación. Hasta hoy soy particularmente sensible a los temas de libertad. El servicio militar obligatorio no es muy distinto de la esclavitud. No era un reclutamiento en nombre de combatir el fascismo. Era un reclutamiento para ejercicios sin sentido, paso de ganso, alarmas tempranas, comidas calientes con prisa y estrés. Si esto servía para la preparación del bloque comunista, sería la preparación del Ejército del Buen Soldado Švejk. Hoy, millones de niños son enviados a la escuela en un esfuerzo similar, parecido a un reclutamiento que roza la esclavitud. Por favor, lean mi » nunca enviaría a mis hijos a la escuela« para conocer mi opinión sobre el atropello coercitivo de los derechos humanos de los niños. Estoy seguro de que algunos de mis sentimientos han sido moldeados por la sensación de esclavitud de 1986.

El día en que la nube radiactiva de Chernóbil pasó sobre Poznan, Polonia, yo estaba ocupado caminando de un punto a otro por toda la ciudad, visitando oficinas militares y civiles en mi esfuerzo por evitar el ejército. Lo logré, y el verano de 1986 fue uno de los más soleados. Pasé mis días programando, corriendo, aprendiendo con SuperMemo (en papel), nadando, jugando fútbol y programando aún más.

Verano de 1986

Mi apetito por software nuevo era insaciable. Escribí un programa para composición musical, para predecir los resultados del Mundial, para el tres en raya en 3D, para escribir exámenes escolares, y muchos más. Conseguí algunos trabajos del Departamento de Bioquímica (Universidad Adam Mickiewicz). Mi héroe, el Prof. Augustyniak, necesitaba software para simular la fusión del ADN y para la búsqueda rápida de genes de ARNt (años después esto derivó en una publicación). También encargó un programa de análisis de regresión que más tarde inspiró avances en SuperMemo (especialmente los Algoritmos SM-6 y SM-8).

Mientras programaba, tenía a SuperMemo todo el tiempo en el fondo de mi mente; sin embargo, todo mi software se caracterizaba por la ausencia de cualquier base de datos. Los programas debían leerse desde una cinta de casete, lo cual era un gran fastidio (aunque no me molestaba en 1986). Era más sencillo mantener mi conocimiento de SuperMemo en papel. Empecé a soñar con un ordenador más grande. Sin embargo, en la Polonia comunista, el costo estaba fuera de alcance. Una vez calculé que un IBM PC costaría tanto como el salario de toda la vida de mi madre en el sistema comunista. Todavía en 1989, no podía permitirme usar un baño en Holanda porque era astronómicamente caro comparado con los salarios en Polonia.

PC 1512

Toda mi familia aportó recursos. Mi primo, el Dr. Garbatowski, gestionó una cuenta especial en divisas para transferencias en marcos alemanes. Por un milagro, pude permitirme un Amstrad PC 1512 de Alemania por 1000 marcos alemanes. El ordenador no fue contrabandeado, como se informó una vez en la prensa. Mi intento fallido de contrabando ocurrió dos años antes, en relación con el ZX Spectrum. Mis amigos de Zaire iban a comprármelo en Berlín Occidental. Al final, compré un ZX Spectrum de segunda mano en Polonia, a buen precio, a alguien que pensaba que estaba vendiendo «solo un teclado».

Figura: Amstrad PC-1512 DD. Mi versión tenía solo una unidad de disquete. El sistema operativo MS-DOS debía cargarse desde un disquete, Turbo Pascal 3.0 desde otro disquete, SuperMemo desde otro más. Para cuando tuve mi primer disco duro en 1991, mi colección de inglés estaba dividida en piezas de 3000 elementos repartidas en 13 disquetes. Tenía muchos más para otras áreas de conocimiento. El 21 de enero de 1997, SuperMemo World localizó ese PC original y lo recompró a su dueño: Jarek Kantecki. El PC estuvo totalmente funcional durante toda la década. Ahora está enterrado en algún lugar de los polvorientos archivos de la empresa. Quizás publiquemos su foto en algún momento. La imagen presentada proviene de Wikipedia

Mi Amstrad-Schneider PC 1512 alemán se pidió a una empresa polaca llamada Olech. Olech debía entregarlo en junio de 1987. Lo hicieron en septiembre. Esto me costó todo el verano de estrés. Algún tiempo después, Krzysztof Biedalak pidió un PC a una empresa holandesa llamada Colgar y nunca recibió ni el PC ni el dinero de vuelta. Si eso me hubiera pasado a mí, habría perdido la confianza en la humanidad. Eso habría matado a SuperMemo. Podría haber matado mi pasión por los ordenadores. Biedalak, en cambio, volvió estoicamente al trabajo duro y recuperó su dinero y más. Esa sería una de las diferencias clave de personalidad entre Biedalak y yo. La resiliencia al estrés debería ser uno de los componentes del desarrollo personal. Yo desarrollé mi resiliencia al estrés tarde, con entrenamiento de autodisciplina (por ejemplo, natación invernal o maratones). Tras perder su dinero, Biedalak no se quejó. Lo recuperó en poco tiempo. Pronto sentí envidia de su nuevo y reluciente PC. Su trabajo duro y determinación para lograr sus objetivos siempre fueron clave para la supervivencia de la empresa. Fue su propio dinero, ganado de forma privada, el que ayudó a SuperMemo World a sobrevivir los primeros meses. No recibió un regalo de sus padres. Siempre podía hacer las cosas por sí mismo.

Simulando el proceso de aprendizaje

El 22 de febrero de 1986, usando mi ZX Spectrum, escribí un programa para simular el proceso de aprendizaje a largo plazo con SuperMemo. Me preocupaba que, con la acumulación de material, el proceso de aprendizaje se ralentizara significativamente. Sin embargo, mis resultados preliminares fueron bastante contraintuitivos: el progreso es casi lineal. No hay mucha desaceleración en el aprendizaje más allá del período inicial.

El 25 de febrero de 1986, amplié el programa de simulación con nuevas funciones que responderían » preguntas candentes sobre la memoria«. El programa se ejecutaría en el Spectrum durante 5 días hasta que pudiera obtener resultados completos para 80 años de aprendizaje. Confirmó mis hallazgos originales.

El 23 de marzo de 1986, logré escribir el mismo programa de simulación en Pascal, que era un lenguaje compilado. Esta vez pude ejecutar la simulación de 80 años en solo 70 minutos. Obtuve los mismos resultados. Hoy, SuperMemo todavía permite ejecutar simulaciones similares. El mismo procedimiento toma solo uno o dos segundos.

Figura: SuperMemo permite simular el curso del aprendizaje durante 15 años usando datos reales recopilados durante las repeticiones.

Algunos de los resultados de aquella simulación siguen siendo válidos hoy. A continuación presento algunos de los hallazgos originales. Es posible que algunos hayan sido corregidos en 1990 o 1994.

La curva de aprendizaje es casi lineal

La curva de aprendizaje obtenida con el modelo, salvo por el período inicial, es casi lineal.

Figura: Curva de aprendizaje para un material genérico, con un índice de olvido igual al 10% y un tiempo de trabajo diario de 1 minuto.

Los elementos nuevos consumen el 5% del tiempo

En un proceso a largo plazo, para un índice de olvido igual al 10%, y para un tiempo de trabajo diario fijo, el tiempo promedio dedicado a memorizar elementos nuevos es solo el 5% del tiempo total dedicado a las repeticiones. Este valor es casi independiente del tamaño del material de aprendizaje.

Velocidad de aprendizaje

Según la simulación, el número de elementos memorizados en años consecutivos trabajando un minuto al día puede aproximarse con la siguiente ecuación:

NewItems=aar*(3*e -0.3*year+1)

donde:

  • NewItems – elementos memorizados en años consecutivos trabajando un minuto al día,
  • year – número ordinal del año,
  • aar – tasa de adquisición asintótica, es decir, la tasa mínima de aprendizaje alcanzada tras muchos años de repeticiones (usualmente cerca de 200 elementos/año/min)

En un proceso a largo plazo, para un índice de olvido igual al 10%, la tasa media de aprendizaje para material genérico puede aproximarse a 200-300 elementos/año/min, es decir, un minuto de aprendizaje al día resulta en la adquisición de 200-300 elementos al año. Los usuarios de SuperMemo normalmente reportan una tasa media de aprendizaje de 50 a 2000 elementos/año/min.

Carga de trabajo

Para un material genérico y un índice de olvido de aproximadamente el 10%, la función del tiempo requerido diariamente para las repeticiones por elemento puede aproximarse en términos generales usando la fórmula:

time=1/500*year -1.5+1/30000

donde:

  • time – tiempo diario promedio dedicado a las repeticiones por elemento en un año dado (en minutos),
  • year – año del proceso.

Dado que el tiempo necesario para las repeticiones de un solo elemento es casi independiente del tamaño total del material aprendido, la fórmula anterior puede usarse para aproximar la carga de trabajo para material de aprendizaje de cualquier tamaño. Por ejemplo, la carga de trabajo total para una colección de 3000 elementos en el primer año será 3000/500*1+3000/30000=6.1 (min/día).

Índice de olvido óptimo

Figura: Carga de trabajo, en minutos por día, en un material de aprendizaje genérico de 3000 elementos, para un índice de olvido igual al 10%.

La mayor tasa global de adquisición de conocimiento se obtiene con un índice de olvido de aproximadamente el 20-30%. Esto resulta del compromiso entre reducir la carga de trabajo de repetición y aumentar la carga de trabajo de reaprendizaje a medida que el índice de olvido avanza hacia arriba. En otras palabras, valores altos del índice de olvido dan lugar a intervalos más largos, pero la ganancia se ve compensada por una carga de trabajo adicional proveniente de un mayor número de elementos olvidados que deben volver a aprenderse.

Para un índice de olvido superior al 20%, el efecto positivo de los intervalos largos sobre la memoria, resultante del efecto de espaciamiento, se ve compensado por el número creciente de elementos olvidados.

Figura: Dependencia de la tasa de adquisición de conocimiento respecto del índice de olvido.

Cuando el índice de olvido cae por debajo del 5%, la carga de trabajo de repetición aumenta rápidamente (véase la figura anterior). El valor recomendado del índice de olvido usado en la práctica del aprendizaje es del 6-14%.

Figura: Compromiso entre la retención del conocimiento ( índice de olvido) y la carga de trabajo (número de repeticiones de un elemento promedio en 10 000 días).

En años posteriores, se descubrió que el valor óptimo del índice de olvido variaba según las herramientas usadas (por ejemplo, el Algoritmo SM-17).

Capacidad de la memoria

La capacidad máxima del cerebro humano a lo largo de la vida para adquirir nuevo conocimiento mediante procedimientos de aprendizaje basados en el modelo discutido puede estimarse en no más de unos pocos millones de elementos. Como es poco probable que alguien dedique toda su vida a aprender, dudo que alguna vez vea a alguien con un millón de elementos en su memoria.

1987: SuperMemo 1.0 para DOS

SuperMemo 1.0 para DOS: día a día (1987)

El archivo histórico de SuperMemo dice » Wozniak escribió su primer SuperMemo en 16 tardes«. La realidad fue algo más compleja, y pensé en describirla con más detalle usando las notas del día.

No logro entender qué quise decir cuando escribí el 3 de julio de 1987 que » tengo la idea de un programa revolucionario que organiza mi trabajo y mis experimentos científicos SMTests» (SMTests son las siglas de SuperMemo en papel). Una transición del papel al ordenador parece un paso obvio. Debió haber algún obstáculo mental en el camino que requería «pensar fuera de la caja». Lamentablemente, no anoté los detalles. Hoy solo importa en cuanto ilustra lo insoportablemente lento que puede colarse en la mente una idea aparentemente obvia.

El 8 de septiembre de 1987 llegó mi primer PC desde Alemania (Amstrad PC 1512). ¡Mi entusiasmo era incomparable! No podía dormir. Trabajé toda la noche. El primer programa que planeaba escribir era para aproximaciones matemáticas. SuperMemo era el segundo en la fila.

Figura: Amstrad PC-1512 DD. Mi versión tenía solo una unidad de disquete. El sistema operativo MS-DOS debía cargarse desde un disquete, Turbo Pascal 3.0 desde otro disquete, SuperMemo desde otro más. Para cuando tuve mi primer disco duro en 1991, mi colección de inglés estaba dividida en piezas de 3000 elementos repartidas en 13 disquetes. Tenía muchos más para otras áreas de conocimiento. El 21 de enero de 1997, SuperMemo World localizó ese PC original y lo recompró a su dueño: Jarek Kantecki. El PC estuvo totalmente funcional durante toda la década. Ahora está enterrado en algún lugar de los polvorientos archivos de la empresa. Quizás publiquemos su foto en algún momento. La imagen presentada proviene de Wikipedia

El 16 de octubre de 1987, viernes, en 12 horas escribí mi primer SuperMemo en GW-Basic (719 minutos de programación sin parar). Era lento como un caracol y estaba lleno de fallos. No me gustó mucho. No empecé a aprender con él. ¿Podría ser este el final de SuperMemo? ¿Elección equivocada de lenguaje de programación? Los días ocupados de escuela me tenían atareado con un millón de cosas sin importancia. Efecto escolar típico: no aprender nada sobre todo. Sin tiempo para la creatividad ni el aprendizaje propio. Por suerte, todo ese tiempo seguí usando SuperMemo en papel. La idea de SuperMemo no podía morir. Tenía que automatizarse tarde o temprano.

El 14 de noviembre de 1987, sábado, SuperMemo en papel consiguió su primer usuario: Mike Kubiak. Estaba muy entusiasmado. El fuego seguía ardiendo. El 18 de noviembre aprendí sobre Turbo Pascal. No funcionaba en mi ordenador. En aquellos días, si tenías la tarjeta gráfica equivocada, podías tener problemas. En lugar de Hercules, yo tenía una CGA monocromática (blanco y negro) en modo texto. Logré resolver el problema editando los programas en el editor de texto RPED en lugar de en el entorno de Turbo Pascal. Más tarde conseguí la versión correcta para mi tarjeta de vídeo. Curiosamente, los viejos SuperMemo se muestran en colores. Yo lo programaba en tonos de gris y nunca supe cómo se veía realmente en modo color.

El 21 de noviembre de 1987 fue un día importante. Era sábado. Los días libres de escuela son días de creatividad. Esperaba levantarme a las 9 de la mañana, pero me quedé dormido 72 minutos de más. Esto es malo para el plan, pero suele ser bueno para el cerebro y el rendimiento. Empecé el día con SuperMemo en papel (repasando inglés, biología humana, informática, etc.). Más tarde ese día, leí el manual de mi Amstrad PC, aprendí sobre Pascal y Prolog, pasé algo de tiempo pensando en cómo podría funcionar la corteza humana, hice algo de ejercicio y, ya avanzada la noche, algo cansado, después de reflexionar, decidí escribir SuperMemo para DOS. Este sería mi segundo intento. Sin embargo, esta vez elegí Turbo Pascal 3.0 y nunca me arrepentí. Hasta hoy, como consecuencia directa, el código de SuperMemo 17 está escrito en Pascal (Delphi).

Para que conste, el nombre SuperMemo se propuso mucho después. En aquellos días, llamaba a mi programa: SMTOP, por Super-Memorization Test Optimization Program. En 1988, Tomasz Kuehn insistió en que lo llamáramos CALOM, por Computer-Aided Learning Optimization Method.

El 22 de noviembre de 1987 fue una copia especular del 21 de noviembre. Concluí que sabía cómo funciona la corteza y que algún día sería bueno construir un ordenador usando principios similares (véase el trabajo de Jeff Hawkins). El hecho de que volviera a programar SuperMemo ya entrada la noche, es decir, un momento muy malo para el trabajo creativo, parece indicar que la pasión todavía no se había encendido.

El 23 de noviembre de 1987 se vio idéntico. No estoy seguro de por qué no tuve obligaciones escolares el lunes, pero eso quizás salvó a SuperMemo. El 24 de noviembre de 1987, se encendió la emoción y trabajé 8 horas seguidas (de nuevo por la noche). El programa tenía un menú sencillo y podía añadir nuevos elementos a la base de datos.

El 25 de noviembre de 1987 se desperdició: tuve que ir a la escuela, estaba cansado y con sueño. Tuvimos clases insoportablemente aburridas de arquitectura de ordenadores, probablemente una década por detrás de la situación real en occidente.

El 26 de noviembre volvió a ser libre, y de nuevo pude ponerme al día con el trabajo de SuperMemo. El programa creció hasta unos enormes 15 400 bytes. Concluí que el programa podría ser » very usefull» (sic).

El 27 de noviembre añadí 3 horas más de trabajo después de la escuela.

El 28 de noviembre fue sábado y pude añadir 12 horas entusiastas de programación sin parar. SuperMemo ya parecía casi listo para usarse.

El 29 de noviembre, domingo, voté por las reformas económicas y la democratización en Polonia. Por la noche, no avancé mucho. Tenía que preparar un ensayo para mi clase de inglés. El ensayo describía el día en que experimenté con alcohol, allá por 1982. Yo era abstemio, pero como biólogo, concluí que necesitaba saber cómo afecta el alcohol a la mente.

El 30 de noviembre se desperdició en la escuela, pero tuvimos un lindo paseo a casa con Biedalak. Tuvimos una larga conversación en inglés sobre nuestro futuro. Ese futuro sería sobre todo sobre ciencia, probablemente en Estados Unidos.

Del 1 al 4 de diciembre se perdieron de nuevo en la escuela. Sin tiempo para programar. En una conversación con un profesor ruso, me di cuenta de que había olvidado por completo el ruso en solo 6 años. ¡Solía hablarlo con orgullo y fluidez! Tuve que canalizar mi tiempo de programación hacia un software aburrido para diseñar circuitos electrónicos. Tuve que hacerlo para aprobar una clase de electrónica. Tenía un acuerdo con el profesor de que no asistiría, solo escribiría ese software. No aprendí nada, y hasta hoy lamento la pérdida de tiempo. Si hubiera sido libre, podría haber invertido esa energía en SuperMemo.

El 5 de diciembre fue sábado. Libre de la escuela. ¡Genial! Sin embargo, tuve que empezar desperdiciando 4 horas en un «procedimiento de código de teclas». En aquellos días, incluso decodificar la tecla presionada podía ser un desafío. Y luego otra hora perdida cambiando algunos atributos de pantalla. Además, añadí 6 horas para escribir el «editor de elementos». Así podía editar cómodamente los elementos en SuperMemo. Las cosas sin esfuerzo que hoy damos por sentadas: cursor a la izquierda, cursor a la derecha, borrar, arriba, nueva línea, etc., necesitaban un día entero de programación en aquel entonces.

El 6 de diciembre fue un lindo domingo. Pasé 7 horas depurando SuperMemo, añadiendo el «repaso final», etc. La emoción seguía creciendo. En una semana, podría empezar a usar mi nuevo software revolucionario de aprendizaje veloz.

El lunes 7 de diciembre, después de la escuela, añadí un procedimiento para eliminar elementos.

El 8 de diciembre, mientras Reagan y Gorbachov firmaban su acuerdo nuclear, añadí un procedimiento para buscar elementos y mostrar algunas estadísticas de los elementos. SuperMemo «se infló» a 43 800 bytes.

El 9 de diciembre estuvo marcado por la escuela y la programación para la clase de electrónica.

El 10 de diciembre celebré los cortes de luz en la escuela. En lugar de clases aburridas, pude hacer algo de programación extra.

El 11 de diciembre tuvimos una linda clase con una de las mentes más brillantes de la escuela: el Prof. Jan Węglarz. Insistió en que podía lograr más en Polonia que en el extranjero. Fue un mensaje poderoso. Sin embargo, en 2018, su entrada de Wikipedia dice que el descubrimiento de su método de dos fases fue ignorado, y más tarde duplicado en occidente porque optó por publicar en polaco. Węglarz de hecho creó un equipo formidable de las mejores mentes de investigación de operaciones en Poznan. Si no me hubiera inclinado hacia SuperMemo, seguro habría llegado con el sombrero en la mano buscando una oportunidad de empleo. Por la noche, añadí un procedimiento para inspeccionar el número de elementos a repasar cada día (la Carga de Trabajo de hoy).

El 12 de diciembre fue sábado. Amplié SuperMemo con un editor de cola pendiente, y parecía listo para empezar a aprender, sin embargo…

… el 13 de diciembre me golpeó una bomba: » Sin memoria disponible«. Logré arreglar el problema de algún modo optimizando el código. La última opción que necesitaba añadir era que el programa leyera la fecha. Sí. Ese fue un gran truco. Sin eso, tendría que escribir la fecha actual al empezar a trabajar con el programa. Finalmente, por fin, en la tarde del 13 de diciembre de 1987, pude añadir mis primeros elementos a mi colección de biología humana: preguntas sobre el sistema nervioso autónomo. Para el 23 de diciembre de 1987, mis bases de datos combinadas de papel y ordenador incluían 3795 preguntas sobre biología humana (de las cuales casi el 10% ya estaban en SuperMemo). Lamentablemente, tuve que eliminar los historiales completos de repetición de SuperMemo ese día. No había suficiente espacio en los disquetes de 360K. La investigación sobre la repetición espaciada tendría que esperar unos años más.

Figura: SuperMemo 1.0 para DOS (1987).

Algoritmo SM-2

Aquí está la descripción del algoritmo usado en SuperMemo 1.0. La descripción se tomó de mi tesis de maestría escrita 2 años y medio después (1990). SuperMemo 1.0 fue reemplazado pronto por un SuperMemo 2.0 más agradable que podía regalar a amigos de la universidad. Hubo actualizaciones insignificantes del algoritmo, que se nombró Algoritmo SM-2 según la versión de SuperMemo. Esto significa que nunca existió un Algoritmo SM-1.

Dominé 1000 preguntas de biología en los primeros 8 meses. Aún mejor, memoricé exactamente 10 000 pares de palabras en inglés en los primeros 365 días trabajando 40 min/día. Esta cifra se usó como referencia al anunciar SuperMemo en sus primeros días comerciales. Incluso hoy, 40 minutos son la inversión diaria recomendada para dominar Advanced English en 4 años (más de 40 000 elementos).

Hasta hoy, el Algoritmo SM-2 sigue siendo popular y todavía lo usan aplicaciones como Anki, Mnemosyne y otras más.

Aviso de archivo: ¿Por qué usar archivos literales?

3.2. Aplicación de un ordenador para mejorar los resultados obtenidos al trabajar con el método SuperMemo

Escribí el primer programa SuperMemo en diciembre de 1987 (Turbo Pascal 3.0, IBM PC). Estaba pensado para mejorar el método SuperMemo de dos maneras básicas:

  • aplicar los procedimientos de optimización a los elementos más pequeños posibles (en el SuperMemo basado en papel, los elementos se agrupaban en páginas),
  • diferenciar entre los elementos según su distinta dificultad.

Habiendo observado que los intervalos sucesivos entre repeticiones aumentan por un factor aproximadamente constante (por ejemplo, dos en el caso del algoritmo SM-0 para vocabulario de inglés), decidí aplicar la siguiente fórmula para calcular los intervalos entre repeticiones:

I(1):=1

I(2):=6

para n>2 I(n):=I(n-1)*EF

donde:

  • I(n) – intervalo entre repeticiones tras la n-ésima repetición (en días)
  • EF – factor de facilidad que refleja la facilidad de memorizar y retener un elemento dado en la memoria (más tarde llamado el E-Factor).

Se permitió que los E-Factores variaran entre 1.1 para los elementos más difíciles y 2.5 para los más fáciles. En el momento de introducir un elemento en una base de datos de SuperMemo, se asumía que su E-Factor era igual a 2.5. En el curso de las repeticiones, este valor se reducía gradualmente en caso de problemas de recuerdo. Así, cuanto mayores eran los problemas que causaba un elemento al recordarlo, más significativa era la reducción de su E-Factor.

Poco después de haberse implementado el primer programa SuperMemo, noté que los E-Factores no debían caer por debajo del valor de 1.3. Los elementos con E-Factores inferiores a 1.3 se repetían con una frecuencia molesta y siempre parecían tener defectos inherentes en su formulación (usualmente no se ajustaban al principio de información mínima). Así, no dejar que los E-Factores cayeran por debajo de 1.3 mejoró sustancialmente el rendimiento del proceso y proporcionó un indicador de los elementos que debían reformularse. La fórmula usada para calcular los nuevos E-Factores de los elementos se construyó de forma heurística y no cambió mucho en los siguientes 3.5 años de uso del método SuperMemo basado en ordenador.

Para calcular el nuevo valor de un E-Factor, el estudiante debe evaluar la calidad de su respuesta a la pregunta formulada durante la repetición de un elemento (mis programas SuperMemo usan la escala de calificación de 0 a 5, un rango determinado por la ergonomía del uso del teclado numérico). La forma general de la fórmula usada era:

EF’:=f(EF,q)

donde:

  • EF’ – nuevo valor del E-Factor
  • EF – valor anterior del E-Factor
  • q – calidad de la respuesta
  • f – función utilizada en el cálculo de EF’.

La función f tenía inicialmente un carácter multiplicativo y en versiones posteriores del programa SuperMemo, cuando la interpretación de los E-Factors cambió sustancialmente, se convirtió en una aditiva sin alterar significativamente las dependencias entre EF’, EF y q. Para simplificar las siguientes consideraciones, solo se tiene en cuenta la función f en su forma más reciente:

EF’:=EF-0.8+0.28*q-0.02*q*q

que es una forma reducida de:

EF’:=EF+(0.1-(5-q)*(0.08+(5-q)*0.02))

Nótese que para q=4 el E-Factor no cambia.

Consideremos ahora la forma final del algoritmo SM-2, que con pequeños cambios se utilizó en los programas SuperMemo, versiones 1.0-3.0, entre el 13 de diciembre de 1987 y el 9 de marzo de 1989 (el nombre SM-2 se eligió porque SuperMemo 2.0 fue, con diferencia, la versión más popular que implementaba este algoritmo).

Algoritmo SM-2 utilizado en la variante informática del método SuperMemo, e implica el cálculo de los factores de facilidad (easiness factors) de cada elemento:

  1. Divide el conocimiento en los elementos más pequeños posibles.
  2. Asocia a todos los elementos un E-Factor igual a 2.5.
  3. Repite los elementos usando los siguientes intervalos:I(1):=1I(2):=6para n>2: I(n):=I(n-1)*EFdonde:
    • I(n) – intervalo entre repeticiones tras la n-ésima repetición (en días),
    • EF – E-Factor de un elemento dado
    Si el intervalo es una fracción, redondéalo al entero superior más cercano.
  4. Después de cada repetición, evalúa la calidad de la respuesta en una escala de 0 a 5:5 – respuesta perfecta4 – respuesta correcta tras cierta vacilación3 – respuesta correcta recordada con dificultad considerable2 – respuesta incorrecta; la correcta parecía fácil de recordar1 – respuesta incorrecta; se recordó la correcta0 – laguna total.
  5. Después de cada repetición, modifica el E-Factor del elemento recién repetido según la fórmula:EF’:=EF+(0.1-(5-q)*(0.08+(5-q)*0.02))donde:
    • EF’ – nuevo valor del E-Factor,
    • EF – valor anterior del E-Factor,
    • q – calidad de la respuesta en la escala de 0 a 5.
    Si EF es menor que 1.3, entonces haz que EF sea 1.3.
  6. Si la calidad de la respuesta fue inferior a 3, reinicia las repeticiones del elemento desde el principio sin cambiar el E-Factor (es decir, usa los intervalos I(1), I(2), etc., como si el elemento se hubiera memorizado de nuevo).
  7. Después de cada sesión de repetición de un día determinado, repite de nuevo todos los elementos que hayan obtenido menos de cuatro en la evaluación de calidad. Continúa las repeticiones hasta que todos estos elementos alcancen al menos cuatro.

El procedimiento de optimización empleado para hallar los E-Factors demostró ser muy eficaz. En los programas SuperMemo siempre encontrarás una opción para mostrar la distribución de los E-Factors (más adelante llamada E-Distribution). La forma de la E-Distribution en una base de datos determinada se establecía aproximadamente en pocos meses desde el inicio de las repeticiones. Esto significa que los E-Factors no cambiaban de forma significativa después de ese periodo, y es razonable presumir que los E-Factors corresponden aproximadamente al factor real por el que deberían aumentar los intervalos entre repeticiones en repeticiones sucesivas.

Durante el primer año de uso del algoritmo SM-2 (aprendiendo vocabulario de inglés), memoricé 10 255 elementos. El tiempo necesario para crear la base de datos y realizar las repeticiones ascendió a 41 minutos al día. Esto corresponde a una tasa de adquisición de 270 elementos/año/minuto. La retención global fue del 89.3%, pero tras excluir los elementos memorizados recientemente (intervalos inferiores a 3 semanas), que no presentan E-Factors correctamente determinados, la retención ascendió al 92%. Al comparar los algoritmos SM-0 y SM-2 hay que tener en cuenta que en el primer caso la retención era artificialmente alta debido a las pistas que recibe el estudiante al repetir los elementos de una página determinada. Los elementos que preceden al que se pregunta pueden sugerir fácilmente la respuesta correcta.Por lo tanto, el algoritmo SM-2, aunque no resulta asombroso en términos de comparaciones cuantitativas, marcó la segunda gran mejora del método SuperMemo tras la introducción del concepto de intervalos óptimos allá por 1985. Separar los elementos previamente agrupados en páginas e introducir los E-Factors fueron los dos componentes principales del algoritmo mejorado. Construido mediante el método de ensayo y error, el algoritmo SM-2 demostró en la práctica la corrección de casi todas las premisas básicas que llevaron a su concepción.

1988: Los dos componentes de la memoria

El modelo de dos componentes de la memoria a largo plazo está en la base de SuperMemo, y se expresa explícitamente en el Algoritmo SM-17. Distingue entre lo estable que es un conocimiento en el almacenamiento de la memoria a largo plazo, y lo fácil que resulta recuperarlo. Este sigue siendo un hecho poco conocido y esencial de la teoría del aprendizaje: se puede ser fluido y aun así recordar mal.

La fluidez es un mal indicador del aprendizaje a largo plazo

Componentes de la memoria a largo plazo

Describí por primera vez la idea de los dos componentes de la memoria en un trabajo para mi clase de simulaciones informáticas el 9 de enero de 1988. En ese mismo trabajo, concluí que debían intervenir circuitos distintos en el aprendizaje declarativo y en el procedimental.

Si te detienes un momento, la idea de los dos componentes debería resultar bastante obvia. Si tomas dos elementos justo después de un repaso, uno con un intervalo óptimo corto y otro con un intervalo óptimo largo, el estado de la memoria de ambos debe diferir. Ambos pueden recordarse a la perfección (máxima recuperabilidad) y también deben diferir en cuánto tiempo pueden perdurar en la memoria (distinta estabilidad). Me sorprendió no encontrar literatura al respecto. Sin embargo, si la literatura no menciona la existencia del intervalo óptimo en la repetición espaciada, esta conclusión aparentemente obvia podría estar escondida detrás de otra idea aparentemente obvia: la progresión de intervalos crecientes en el repaso óptimamente espaciado. Esto ilustra maravillosamente cómo el progreso humano es incremental y desesperantemente lento. Somos notoriamente malos para pensar fuera de lo establecido. El lugar más oscuro está bajo el candelabro. Esta debilidad puede romperse con una explosión de comunicación en la web. Abogo por menos revisión por pares y más audacia a la hora de plantear hipótesis. Pienso en un ejemplo fantástico proveniente del trabajo de Robin Clarke sobre el Alzheimer. La revisión por pares estricta recuerda a la educación prusiana: en la búsqueda de la perfección, perdemos nuestra creatividad, luego nuestra humanidad y, finalmente, el placer de vivir.

Cuando presenté por primera vez mis ideas a mi profesor, el Dr. Katulski, el 19 de febrero de 1988, no quedó demasiado impresionado, pero me aprobó el crédito de simulaciones informáticas. Curiosamente, algún tiempo después, Katulski se convirtió en uno de los primeros usuarios de SuperMemo 1.0 para DOS.

En mi tesis de máster (1990), añadí una demostración algo más formal de la existencia de los dos componentes. Esa parte de mi tesis pasó desapercibida.

En 1994, J. Kowalski escribió en Enter, Polonia:

Llegamos al punto en que la interpretación evolutiva de la memoria indica que funciona según los principios del aumento de intervalos y del efecto de espaciamiento. ¿Hay alguna prueba de este modelo de memoria más allá de la especulación evolutiva? En su tesis doctoral, Wozniak discutió ampliamente aspectos moleculares de la memoria y presentó un modelo hipotético de los cambios que ocurren en la sinapsis durante el proceso de aprendizaje. El elemento novedoso presentado en la tesis fue la distinción entre la estabilidad y la recuperabilidad de las huellas de memoria. Esto no podía usarse para respaldar la validez de SuperMemo por el simple hecho de que fue el propio SuperMemo el que sentó las bases de la hipótesis. Sin embargo, una creciente evidencia molecular parece coincidir con el modelo de estabilidad-recuperabilidad, aportando al mismo tiempo respaldo a la corrección de las premisas que llevaron a SuperMemo. En términos sencillos, la recuperabilidad es una propiedad de la memoria que determina el nivel de eficiencia con el que las sinapsis pueden dispararse en respuesta a un estímulo, y así desencadenar la acción aprendida. Cuanto menor sea la recuperabilidad, menos probable es que recuerdes la respuesta correcta a una pregunta. Por otro lado, la estabilidad refleja el historial de repeticiones anteriores y determina el periodo de tiempo durante el cual pueden mantenerse las huellas de memoria. Cuanto mayor sea la estabilidad de la memoria, más tiempo tardará la recuperabilidad en caer al nivel cero, es decir, al nivel en que los recuerdos se pierden de forma permanente. Según Wozniak, cuando aprendemos algo por primera vez experimentamos un ligero aumento de la estabilidad y la recuperabilidad en las sinapsis implicadas en codificar esa asociación estímulo-respuesta en concreto. Con el tiempo, la recuperabilidad disminuye rápidamente; el fenómeno equivalente al olvido. Al mismo tiempo, la estabilidad de la memoria se mantiene en un nivel aproximadamente igual. Sin embargo, si repetimos la asociación antes de que la recuperabilidad caiga a cero, esta recupera su valor inicial, mientras que la estabilidad aumenta a un nuevo nivel, sustancialmente más alto que en el aprendizaje inicial. Antes de la siguiente repetición, debido a la mayor estabilidad, la recuperabilidad disminuye a un ritmo más lento, y el intervalo entre repeticiones puede ser mucho más largo antes de que se produzca el olvido. También deben señalarse otras dos propiedades importantes de la memoria: (1) las repeticiones no tienen capacidad para aumentar la estabilidad cuando la recuperabilidad es alta (efecto de espaciamiento), (2) al producirse el olvido, la estabilidad disminuye rápidamente

Publicamos nuestras ideas con los Dres. Janusz Murakowski y Edward Gorzelańczyk en 1995. Murakowski perfeccionó la demostración matemática. Gorzelańczyk desarrolló el modelo molecular. No hemos recibido demasiado entusiasmo ni comentarios por parte de la comunidad científica. La idea de los dos componentes de la memoria es como el vino, cuanto más envejece, mejor sabe. Seguimos preguntándonos cuándo recibirá un reconocimiento más amplio. Al fin y al cabo, no vivimos en la época de Mendel para mantener una buena joya escondida en algún archivo oscuro. Hay millones de usuarios de la repetición espaciada, e incluso si un 0.1% se interesara por la teoría, oirían hablar de nuestros dos componentes. Hoy en día, incluso el algoritmo más reciente de SuperMemo se basa en el modelo de dos componentes y funciona a las mil maravillas. Irónicamente, los usuarios tienden a inclinarse hacia soluciones más simples donde toda la mecánica de la memoria humana permanece oculta. Incluso en supermemo.com nos aseguramos de no asustar a los clientes con un exceso de números en pantalla.

El concepto de los dos componentes de la memoria guarda paralelismos con investigaciones anteriores, especialmente las de Bjork.

En la década de 1940, los científicos investigaron la fuerza del hábito y la fuerza de la respuesta como componentes independientes del comportamiento en ratas. Esos conceptos se reformularon más tarde en la teoría del desuso de Bjork. Herbert Simon parece haber notado la necesidad de una variable de estabilidad de la memoria en su trabajo de 1966. En 1969, Robert Bjork formuló la Paradoja de la Fuerza: una relación inversa entre la probabilidad de recordar y el efecto en la memoria de un repaso. Nótese que esto es una reformulación del efecto de espaciamiento en términos del modelo de dos componentes, que está a solo un pequeño paso de formular la distinción entre las variables de la memoria. Esto condujo a la Nueva Teoría del Desuso de Bjork (1992) que distinguiría entre la fuerza de almacenamiento y la fuerza de recuperación. Son equivalentes cercanos a la recuperabilidad y la estabilidad, con una interpretación ligeramente distinta de los mecanismos subyacentes a la distinción. Lo más llamativo es que Bjork cree que cuando la recuperabilidad cae a cero, los recuerdos estables aún se conservan (en nuestro modelo, la estabilidad se vuelve indeterminada). A nivel celular, Bjork podría tener razón, al menos durante un tiempo, pero la práctica de SuperMemo muestra el poder del olvido completo, mientras que, desde el punto de vista neuronal, retener recuerdos en desuso sería muy ineficiente independientemente de su estabilidad. Por último, Bjork define la fuerza de almacenamiento en términos de conectividad, lo cual está muy cerca de lo que creo que ocurre en los buenos estudiantes: la coherencia afecta a la estabilidad.

¿Por qué los dos componentes de la memoria aún no forman parte de la investigación convencional? Sostengo que si la mente humana tiende a ser miope, y todos lo somos, por diseño, la mente de la ciencia puede quedar realmente estrangulada por obligaciones agotadoras: publicar o perecer, las batallas por las subvenciones, las jerarquías, los conflictos de interés, la revisión por pares, las obligaciones docentes e incluso el código de conducta. Los investigadores de la memoria tienden a vivir en una única dimensión de «fuerza de la memoria». En esa dimensión, no pueden apreciar de verdad la dinámica real de los procesos moleculares que hay que investigar para resolver el problema. Irónicamente, el progreso podría venir de quienes trabajan en inteligencia artificial o redes neuronales. Las mentes prodigiosas de Demis Hassabis o Andreas Knoblauch llegan a ideas gemelas mediante procesos de razonamiento, modelos y simulaciones independientes. Los biólogos tendrán que escuchar el lenguaje de las matemáticas o de la informática.

El modelo de dos componentes en el Algoritmo SM-17

El modelo de dos componentes de la memoria a largo plazo subyace al Algoritmo SM-17. El éxito del Algoritmo SM-17 es la prueba práctica definitiva de la corrección del modelo.

Un gráfico de los cambios reales en el valor de los dos componentes de la memoria ofrece una visualización conceptual de la evolución del estado de la memoria:

Figura: Cambios en el estado de la memoria a lo largo del tiempo para un elemento de ejemplo. El eje horizontal representa el tiempo abarcando todo el historial de repeticiones. El panel superior muestra la recuperabilidad (elevada a la décima potencia, R^10, para facilitar el análisis). La cuadrícula de recuperabilidad en gris está etiquetada con R=99%, R=98%, etc. El panel central muestra los intervalos óptimos en azul marino. Las fechas de repetición están marcadas con líneas verticales azules y etiquetadas en azul aguamarina. El final del intervalo óptimo, donde R cruza la línea del 90%, está marcado con líneas verticales rojas (solo si los intervalos son más largos que los intervalos óptimos). El panel inferior visualiza la estabilidad (presentada como ln(S)/ln(days) para facilitar el análisis). El gráfico muestra que la recuperabilidad cae rápido (exponencialmente) tras las primeras repeticiones, cuando la estabilidad es baja; sin embargo, solo cae del 100% al 94% en los largos 10 años posteriores a la séptima revisión. Todos los valores se derivan de un historial de repetición real y del modelo de tres componentes de la memoria.

Debido al hecho de que la aplicación en la vida real de SuperMemo requiere abordar material de aprendizaje de diversa dificultad, la tercera variable implicada en el modelo es la dificultad del elemento (D). Algunas de las implicaciones de la dificultad del elemento también se han discutido en el artículo anterior. En particular, el impacto de las memorias compuestas con subcomponentes de distinta estabilidad de la memoria (S).

Para los fines del nuevo algoritmo hemos definido los tres componentes de la memoria de la siguiente manera:

  • La Estabilidad de la Memoria (S) se define como el intervalo entre repeticiones que produce una probabilidad media de recuerdo de 0.9 en el momento del repaso
  • La Recuperabilidad de la Memoria (R) se define como la probabilidad esperada de recuerdo en cualquier momento, asumiendo un olvido negativamente exponencial de material de aprendizaje homogéneo, con la constante de decaimiento determinada por la estabilidad de la memoria (S)
  • La Dificultad del Elemento (D) se define como el aumento máximo posible en la estabilidad de la memoria (S) en el repaso, mapeado linealmente en el intervalo 0..1, siendo 0 los elementos más fáciles posibles y 1 la mayor dificultad considerada en SuperMemo (el límite de corte actualmente se sitúa en un aumento de estabilidad 6 veces menor que el máximo posible)

Demostración

A continuación, la demostración real de mi tesis de máster. Para una mejor perspectiva de esta demostración, véase la demostración de Murakowski.

Advertencia de archivo: ¿Por qué usar archivos literales?

10.4.2. Dos variables de la memoria: estabilidad y recuperabilidad

Hay una conclusión importante que se desprende directamente de la teoría de SuperMemo: que existen dos, y no una, como comúnmente se cree, variables independientes que describen la conductividad de una sinapsis y de la memoria en general. Para ilustrar el caso, consideremos de nuevo el modelo de la calpaína de la memoria sináptica. Es obvio, a partir del modelo, que sus autores asumen que solo se necesita una variable independiente para describir la conductividad de una sinapsis. La afluencia de calcio, la actividad de la calpaína, la degradación de la fodrina y el número de receptores de glutamato son todos ejemplos de dicha variable. Nótese que todos los parámetros mencionados son dependientes, es decir, conociendo uno de ellos podríamos calcular todos los demás; obviamente, solo si fuéramos capaces de construir las fórmulas correspondientes. La dependencia de los parámetros es consecuencia directa de los vínculos causales entre todos ellos.

Sin embargo, el proceso de aprendizaje óptimo requiere exactamente dos variables independientes para describir el estado de una sinapsis en un momento dado:

  • Una variable que desempeña el papel de reloj, midiendo el tiempo entre repeticiones. Algunos parámetros de ejemplo que se pueden usar aquí son:
    • e – tiempo transcurrido desde la última repetición (pertenece al rango <0,intervalo-óptimo>),
    • l – tiempo que debe transcurrir antes de que tenga lugar la siguiente repetición (T l=intervalo-óptimo-T e),
    • f – probabilidad de que la sinapsis pierda la huella de memoria durante el día en cuestión (pertenece al rango <0,1>).
    Obviamente, se puede concebir un número incontable de parámetros que podrían usarse para representar la variable del reloj. Todos estos parámetros son dependientes, es decir, uno de ellos basta para calcular todos los demás.
  • Una variable que mide la durabilidad de la memoria. Algunos parámetros de ejemplo que se pueden usar aquí son:
    • I(n+1) – intervalo óptimo que debería usarse tras la siguiente repetición (I(n+1)=I(n)*C, donde C es una constante mayor que tres),
    • I(n) – intervalo óptimo actual,
    • n – número de repeticiones que preceden al momento en cuestión, etc.
    De nuevo, los parámetros son dependientes y solo uno de ellos es necesario para caracterizar la durabilidad de la memoria.

Veamos ahora si las variables anteriores son necesarias y suficientes para caracterizar el estado de las sinapsis en el proceso de aprendizaje óptimo en el tiempo. Para demostrar que las variables son independientes, mostraremos que ninguna de ellas puede calcularse a partir de la otra. Observemos que el parámetro I(n) permanece constante durante un intervalo entre repeticiones dado, mientras que el parámetro T e cambia de cero a I(n). Esto demuestra que no existe ninguna función f que satisfaga la condición:

e=f(I(n))

Por otro lado, en el momento de las repeticiones sucesivas, T e siempre es igual a cero, mientras que I(n) siempre tiene un valor distinto y creciente. Por lo tanto, no existe ninguna función g que satisfaga la condición:

I(n)=g(T e)

De ahí la independencia de I(n) y T e.

Para demostrar que no se necesitan otras variables en el proceso de aprendizaje óptimo, observemos que en cualquier momento dado podemos calcular todos los momentos de las repeticiones futuras usando el siguiente algoritmo:

  1. Deja que transcurran I(n)-T e días.
  2. Que haya una repetición.
  3. Que T e sea cero e I(n) aumente C veces.
  4. Ve al paso 1.

Nótese que el valor de C es una constante característica de una sinapsis dada y, como tal, no cambia en el proceso de aprendizaje. Más adelante usaré el término recuperabilidad para referirme a la primera de las variables y el término estabilidad para referirme a la segunda. Para justificar la elección del primer término, observemos que solemos pensar que los recuerdos son fuertes tras una tarea de aprendizaje y que luego se desvanecen hasta dejar de poder recuperarse. Es la recuperabilidad la que determina el momento en que los recuerdos dejan de estar disponibles. También vale la pena mencionar que la recuperabilidad fue la variable que se asumió tácitamente como la única necesaria para describir la memoria (como en el modelo de la calpaína). La invisibilidad de la variable de estabilidad se debió a que los investigadores concentraron sus esfuerzos en una única tarea de aprendizaje y en la observación de los cambios posteriores en las sinapsis, mientras que la importancia de la estabilidad solo puede visualizarse en el proceso de repetir la misma tarea muchas veces. Para concluir el análisis de las variables de la memoria, planteemos la pregunta estándar que debe formularse al desarrollar cualquier modelo biológico. ¿Cuál es la posible ventaja evolutiva que se deriva de la existencia de dos variables de la memoria?

La recuperabilidad y la estabilidad son ambas necesarias para codificar un proceso de aprendizaje que permita que los intervalos sucesivos entre repeticiones aumenten en longitud sin que se produzca el olvido. Puede demostrarse fácilmente que dicho modelo de aprendizaje es el mejor en cuanto a la tasa de supervivencia de un individuo, si reconocemos el hecho de que recordar sin olvidar en poco tiempo saturaría el sistema de memoria, que es finito. Si la memoria ha de ser olvidadiza, debe contar con algún medio para retener aquellas huellas que parecen importantes para la supervivencia. La repetición como factor de refuerzo de la memoria es uno de esos medios. Consideremos ahora cuál es la temporización más adecuada del proceso de repetición. Si un fenómeno determinado se encuentra por n-ésima vez, la probabilidad de que se vuelva a encontrar por (n+1)-ésima vez aumenta, y por lo tanto un tiempo de retención de la memoria más largo parece ventajoso. La función exacta que describe el mejor proceso de repetición depende del tamaño del almacenamiento de memoria, del número de fenómenos posibles que un individuo puede encontrar, y de muchos otros factores. Sin embargo, la utilidad de intervalos crecientes necesarios para sostener la memoria mediante repeticiones es indiscutible, al igual que el valor evolutivo de la recuperabilidad y la estabilidad de la memoria. Se pueden imaginar muchas situaciones que interfieren con esta sencilla imagen del desarrollo de la memoria a lo largo de la evolución. Por ejemplo, los eventos asociados con un estrés intenso deberían recordarse mejor. De hecho, este hecho se demostró en investigaciones sobre la influencia de las catecolaminas en el aprendizaje. Quizás, mediante estimulación hormonal, se podría mejorar el rendimiento de un estudiante que aplica el método SuperMemo.

Resumen provisional

  1. Se postuló la existencia de dos variables independientes necesarias para describir el proceso de aprendizaje óptimo. Estas variables se denominaron recuperabilidad y estabilidad de la memoria
  2. La recuperabilidad de la memoria refleja el tiempo transcurrido entre repeticiones e indica en qué medida las huellas de memoria pueden usarse con éxito en el proceso de recuerdo
  3. La estabilidad de la memoria refleja el historial de repeticiones en el proceso de aprendizaje y aumenta con cada estimulación de la sinapsis. Determina la duración del intervalo óptimo entre repeticiones

Figura: Mecanismo hipotético implicado en el proceso de aprendizaje óptimo. (A) Fenómenos moleculares (B) Cambios cuantitativos en la sinapsis.

Demostración de Murakowski

Aquí presentamos una demostración mejorada de Murakowski:

Investigaciones anteriores han demostrado que el espaciamiento óptimo de las repeticiones en el aprendizaje de asociaciones emparejadas, entendido como el espaciamiento que requiere un número mínimo de repeticiones para mantener indefinidamente un nivel constante de retención de conocimiento (por ejemplo, 95%), puede expresarse aproximadamente mediante las siguientes fórmulas ( Wozniak y Gorzelańczyk, 1994).

  • (1) I 1=C 1
  • (2) I i=I i-1*C 2

donde:

  • i – intervalo entre repeticiones tras la i-ésima repetición
  • 1 – duración del primer intervalo (depende de la retención de conocimiento elegida, y suele equivaler a varios días)
  • 2 – constante que denota el aumento de los intervalos entre repeticiones en repeticiones sucesivas (depende de la retención de conocimiento elegida y de la dificultad del elemento recordado)

Las fórmulas anteriores se hallaron para sujetos humanos utilizando procedimientos de optimización informática empleados para supervisar el proceso de aprendizaje autopautado de pares de palabras mediante la técnica de recuerdo activo con eliminación progresiva. […]

Como se mostrará a continuación, la ampliamente investigada fuerza de la memoria (o potenciación sináptica) no basta para explicar el patrón regular del espaciamiento óptimo de repeticiones: […]

  1. Queremos determinar el conjunto de variables (moleculares) implicadas en el almacenamiento de las huellas de memoria que baste para explicar el espaciamiento óptimo de las repeticiones. Asumamos, inicialmente, dos correlatos de estas variables en un aprendizaje sujeto al espaciamiento óptimo tal como se expresa en las Ecs. (1) y (2):r – tiempo que queda desde el momento presente hasta el final del intervalo óptimo actual (el intervalo óptimo es aquel al final del cual la retención cae al nivel previamente definido, por ejemplo, 95%)s – duración del intervalo óptimo actual.
  2. Justo al inicio de la i-ésima repetición, r=0, mientras que s is i-1>0 ( s i denota s justo al inicio de la i-ésima repetición). Esto indica que no existe ninguna función g 1 tal que s=g 1r), es decir, s no puede ser función únicamente de r.
  3. Durante el intervalo entre repeticiones, r(t 1)<> r(t 2) si t 1<>t 2 (t denota el tiempo y r(t) denota r en el momento t). Por otro lado, s(t 1)= s(t 2) ( s(t) denota s en el momento t). Esto muestra que no existe ninguna función g 2 tal que r=g 2s), o tendríamos: r(t 1)=g 2s(t 1))=g 2 ( s(t 2))= r(t 2), lo cual lleva a una contradicción. r no puede ser función únicamente de s.
  4. En los Pasos 2 y 3 hemos demostrado que r y s son independientes, ya que no existen funciones g 1 y g 2 tales que s=g 1r) o r=g 2s). Esto obviamente no significa que no exista ningún parámetro x y funciones y s e y r tales que s=y s(x) y r=y r(x).
  5. Puede demostrarse que r y s bastan para calcular el espaciamiento óptimo de las repeticiones (cf. Ecs. (1) y (2)). Asumamos primero que las dos funciones siguientes, f r y f s, son conocidas en el sistema implicado en el almacenamiento de la memoria: r i=f rs i) y s i=f ss i-1). En nuestro caso, estas funciones tienen una forma trivial f rr is i y f ss is i-1*C 2 (donde C 2 es la constante de la Ec. (2)). En tal caso, las variables r y s son suficientes para representar la memoria en cualquier momento t en el espaciamiento óptimo de repeticiones. Aquí tenemos un algoritmo de espaciamiento de repeticiones que demuestra que esto es cierto:
    1. asumamos que las variables r i y s i describen el estado de la memoria tras la i-ésima repetición
    2. dejemos que transcurra un tiempo r i
    3. que haya una repetición
    4. que se use la función f s para calcular el nuevo valor de s i+1 a partir de s i
    5. que se use la función f r para calcular el nuevo valor de r i+1 a partir de s i+1
    6. i:=i+1
    7. ve al paso 2

El razonamiento anterior muestra que las variables r y s forman un conjunto suficiente de variables independientes necesarias para calcular el espaciamiento óptimo de las repeticiones. Obviamente, usando un conjunto de funciones de transformación de la forma r’’=Tr( r’) y s’’=Ts( s’), se puede concebir una familia infinita de pares de variables r– s que podrían describir el estado del sistema de memoria. Queda una elección difícil: escoger un par r– s que corresponda de la forma más conveniente con los fenómenos moleculares que ocurren a nivel de la sinapsis.

Los autores proponen la siguiente terminología e interpretación en un sistema de memoria que implica la existencia del par de variables r– s: la variable R, recuperabilidad, determina la probabilidad con la que una huella de memoria dada puede invocarse en un momento determinado, mientras que la variable S, estabilidad de la memoria, determina la tasa de disminución de la recuperabilidad como resultado del olvido, y, en consecuencia, la duración de los intervalos entre repeticiones en el espaciamiento óptimo de repeticiones.

Asumiendo la disminución negativamente exponencial de la recuperabilidad, y la interpretación de la estabilidad como el recíproco de la constante de decaimiento de la recuperabilidad, podemos representar convenientemente la relación entre R y S mediante la siguiente fórmula (t denota el tiempo):

(3) R=e -t/S

Las funciones de transformación del par r– s usadas en los Pasos 1-5 del razonamiento, hacia la interpretación propuesta R-S, se ven de la siguiente manera (asumiendo la definición del intervalo óptimo entre repeticiones como el intervalo que produce una retención de conocimiento K=0.95):

(4) S=- s/ln(K)

(5) R=e -( s– r)/S

La relación entre la estabilidad tras la i-ésima repetición (S i) y las constantes C 1 y C 2 que determinan el espaciamiento óptimo de las repeticiones, tal como se define en las Ecs. (1) y (2), puede escribirse por tanto como:

(6) S i=-(C 1*C 2 i-1)/ln(K)

y, finalmente, la recuperabilidad en el espaciamiento óptimo de las repeticiones puede expresarse como:

(7) R i(t)=exp (t*ln(K)/(C 1*C 2 i-1))

donde:

  • i – número de la repetición en cuestión
  • t – tiempo transcurrido desde la i-ésima repetición
  • i(t) – recuperabilidad tras el tiempo t transcurrido desde la i-ésima repetición en el espaciamiento óptimo de repeticiones
  • 1 y C 2 – constantes de las Ecs. (1) y (2)
  • K – retención de conocimiento igual a 0.95 (es importante señalar que la relación expresada por la Ec. (7) puede no ser válida para retenciones superiores a 0.95 debido al efecto de espaciamiento resultante de intervalos más cortos)

Los dos componentes de la memoria en SuperMemo

SuperMemo siempre se ha basado en el modelo de dos componentes, que fue emergiendo de forma cada vez más explícita con el tiempo. La constante C 2 en la Ec. (2) de la demostración de Murakowski anterior representa el aumento de estabilidad. En 2018, el aumento de estabilidad se representa en SuperMemo como la matriz SInc[]. C 2 indica cuánto deberían aumentar los intervalos entre repeticiones en el aprendizaje para cumplir los criterios de un nivel de olvido admisible. En realidad, C 2 no es una constante. Depende de varios factores. De estos, los más importantes son:

  • la dificultad del elemento (D)(véase: complejidad): cuanto más difícil sea la información recordada, menor será C 2 (es decir, el material difícil debe repasarse con más frecuencia)
  • la estabilidad de la memoria (S): cuanto más duradera/perdurable sea la memoria, menor será el valor de C 2
  • la probabilidad de recuerdo ( recuperabilidad)(R): cuanto menor sea la probabilidad de recuerdo, mayor será el valor de C 2 (es decir, debido al efecto de espaciamiento, los elementos se recuerdan mejor si se repasan con retraso)

Debido a estas múltiples dependencias, el valor preciso de C 2 no es fácil de predecir. SuperMemo resuelve este y otros problemas de optimización similares utilizando matrices multidimensionales para representar funciones de múltiples argumentos, y ajustando el valor de esas matrices en función de las mediciones realizadas durante un proceso de aprendizaje real. Los valores iniciales de esas matrices se derivan de un modelo teórico o de mediciones previas. Los valores realmente utilizados, con el tiempo, diferirán ligeramente de los predichos teóricamente o de los derivados de datos de estudiantes anteriores.

Por ejemplo, si el valor de C 2 para un elemento dado de una dificultad determinada, con un estado de memoria concreto, produce un intervalo entre repeticiones más largo de lo deseado (es decir, que produce un nivel de recuerdo inferior al deseado), el valor de C 2 se reduce en consecuencia.

Aquí tenemos la evolución del aumento de estabilidad (constante C 2) a lo largo de los años:

  • en la versión en papel y lápiz de SuperMemo (1985), C 2 era efectivamente (casi) una constante. Fijada en un promedio de 1.75 (variando de 1.5 a 2.0 por errores de redondeo y por simplicidad), no tenía en cuenta la dificultad del material, la estabilidad ni la recuperabilidad de los recuerdos, etc.
  • en las primeras versiones de SuperMemo para DOS (1987), C 2, llamada E-Factor, reflejó por primera vez la dificultad del elemento. Disminuía con notas bajas y aumentaba con notas buenas
  • SuperMemo 4 (1989) no usaba C 2, pero, para calcular los intervalos entre repeticiones, empleó por primera vez matrices de optimización
  • en SuperMemo 5 (1990), C 2, llamada O-Factor, finalmente se representó como una matriz e incluyó tanto la dimensión de la dificultad como la de la estabilidad. De nuevo, las entradas de la matriz estarían sujetas al ciclo de medir-verificar-corregir que, partiendo del valor inicial basado en mediciones previas, produciría una convergencia hacia el valor que satisficiera los criterios de aprendizaje
  • en SuperMemo 6 (1991), C 2, en forma de matriz O-Factor, se derivaría de una matriz tridimensional que incluiría la dimensión de la recuperabilidad. La implicación importante de esta tercera dimensión fue que, por primera vez, SuperMemo permitiría inspeccionar las curvas de olvido para distintos niveles de dificultad y estabilidad de la memoria
  • desde SuperMemo 8 (1997) hasta SuperMemo 16, la representación de C 2 no cambió mucho; sin embargo, el algoritmo usado para lograr una transición rápida y estable del conjunto de datos teórico al real se fue volviendo cada vez más complejo. Lo más importante es que las nuevas versiones de SuperMemo hacen un mejor uso de la dimensión de recuperabilidad de C 2. Así, independientemente del efecto de espaciamiento, el estudiante puede apartarse de los criterios de aprendizaje iniciales, por ejemplo, para estudiar de forma intensiva antes de un examen, sin introducir ruido en el procedimiento de optimización
  • en SuperMemo 17 (2016), C 2 finalmente adoptó la forma basada en el modelo original de dos componentes. Se toma de la matriz de aumento de estabilidad (SInc), que tiene tres dimensiones que representan las tres variables que determinan el aumento de estabilidad: la complejidad, la estabilidad y la recuperabilidad. La matriz SInc se va rellenando con datos durante el aprendizaje mediante un algoritmo complejo conocido como Algoritmo SM-17. La matriz de aumento de estabilidad puede consultarse en SuperMemo 17 en Tools : Memory : 4D Graphs (pestaña Stability)

1989: SuperMemo se adapta a la memoria del usuario

Introduciendo la función de intervalo flexible

SuperMemo 2 era estupendo. Su sencillo algoritmo ha sobrevivido en diversas mutaciones hasta hoy en aplicaciones populares como Anki o Mnemosyne. Sin embargo, el algoritmo era «tonto» en el sentido de que no había forma de modificar la función de los intervalos óptimos. Los hallazgos de 1985 quedaron grabados en piedra. La complejidad de la memoria y el aumento de estabilidad se expresaban con un mismo número único: el E-factor. Es un poco como usar una sola palanca en una bicicleta para cambiar de marcha y de dirección al mismo tiempo.

Los elementos individuales podían adaptar el espaciamiento del repaso mediante cambios en su dificultad estimada. Esos cambios podían compensar errores en la función de los intervalos óptimos. Aunque el algoritmo tardaba en converger hacia el óptimo, en teoría, era convergente. El principal defecto era que, en el Algoritmo SM-2, los elementos nuevos no se beneficiaban de la experiencia de los elementos antiguos.

El Algoritmo SM-2 no es adaptable. Los elementos nuevos no se benefician de la experiencia de los elementos antiguos

El Algoritmo SM-4 fue el primer intento de dotar a SuperMemo de adaptabilidad universal. Se completó en febrero de 1989. Al final, la adaptabilidad tardaba demasiado en manifestarse, pero la inspiración obtenida con el Algoritmo SM-4 fue esencial para el progreso posterior, especialmente para entender el problema de estabilidad frente a precisión en la repetición espaciada. En resumen, el Algoritmo SM-4 era demasiado estable para ser preciso. Esto se remedió rápidamente en el Algoritmo SM-5, solo 7 meses después. Aquí tenemos un fragmento de mi tesis de máster para explicar los detalles:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

El principal defecto del Algoritmo SM-2 parece haber sido la forma arbitraria de la función de los intervalos óptimos. Aunque era muy eficaz en la práctica y estaba confirmada por años de repeticiones experimentales, esta función no podía reclamar una validez científicamente demostrada, ni podía detectar el impacto global de variaciones de pocos días en los intervalos óptimos sobre el proceso de aprendizaje. Teniendo en cuenta estos defectos, decidí emplear las repeticiones rutinarias de SuperMemo para validar la función de los intervalos óptimos.

Usando procedimientos de optimización similares a los aplicados para hallar los E-Factors, quería que el programa corrigiera la función inicialmente propuesta cada vez que las correcciones parecieran justificadas.

Para lograr este objetivo, tabulé la función de los intervalos óptimos.

Figura: La matriz de intervalos óptimos apareció en SuperMemo 4 en 1989 y ha sobrevivido hasta hoy en SuperMemo 17 con pocos cambios. La imagen presenta una matriz de SuperMemo 5 y muestra una desviación significativa respecto a los valores originales de la matriz. En SuperMemo 4, las adaptaciones avanzaban a un ritmo mucho más lento

Las entradas particulares de la matriz de intervalos óptimos (más tarde llamada matriz OI) se tomaron inicialmente de las fórmulas usadas en el Algoritmo SM-2.

SuperMemo 4 (febrero de 1989), en el que se implementó la nueva solución, usaba la matriz OI para determinar los valores de los intervalos entre repeticiones:

I(n):=OI(n,EF)

donde:

  • I(n) – el n-ésimo intervalo entre repeticiones de un elemento dado (en días),
  • EF – E-Factor del elemento,
  • OI(n,EF) – la entrada de la matriz OI correspondiente a la n-ésima repetición y al E-Factor EF.

Sin embargo, la matriz OI no era fija de una vez por todas. En el curso de las repeticiones, las distintas entradas de la matriz aumentaban o disminuían dependiendo de las calificaciones. Por ejemplo, si la entrada indicaba que el intervalo óptimo era X y el intervalo utilizado fue X+Y, mientras que la calificación tras ese intervalo no fue inferior a cuatro, entonces el nuevo valor de la entrada quedaría entre X y X+Y.

Así, los valores de las entradas OI en el estado de equilibrio deberían asentarse en el punto donde la corriente de elementos con retención pobre equilibre la corriente de elementos con buena retención en su influencia sobre la matriz.Como consecuencia, SuperMemo 4 pretendía producir una definición definitiva de la función de los intervalos óptimos.

SuperMemo 4, rígido

No me llevó mucho tiempo darme cuenta de que el ciclo de verificación-corrección del nuevo algoritmo era demasiado largo. No era muy distinto de repetir el experimento de 1985 en el ordenador. Para determinar intervalos de décadas de duración, necesitaba que pasara una década para comprobar los resultados del repaso. Esto llevó al Algoritmo SM-5 siete meses después. Aquí está el problema del Algoritmo SM-4 tal como se describe en mi tesis de máster:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

El Algoritmo SM-4 se implementó en SuperMemo 4 y se usó entre el 9 de marzo de 1989 y el 17 de octubre de 1989. Aunque el concepto principal de modificar la función de intervalos óptimos parecía un gran paso adelante, la implementación del algoritmo fue un fracaso. La insuficiencia básica del algoritmo parecía derivarse de las fórmulas aplicadas en la modificación de la matriz OI.

Había dos defectos especialmente llamativos:

  • las modificaciones eran demasiado sutiles para reorganizar visiblemente la matriz OI en un tiempo razonablemente corto,
  • para intervalos entre repeticiones más largos, el efecto de la modificación tenía que esperar mucho tiempo antes de fijarse de forma estable, es decir, hacía falta bastante tiempo antes de que pudiera verse y corregirse, si era necesario, el resultado de una modificación de un intervalo de varios meses de duración

Tras siete meses de usar el Algoritmo SM-4, las matrices OI de las distintas bases de datos no se veían muy diferentes de sus estados iniciales. Esto podría explicarse por la corrección de mis predicciones anteriores sobre los valores reales de los intervalos óptimos entre repeticiones; sin embargo, como se demostró más tarde mediante el Algoritmo SM-5, la razón real de la estabilidad de las matrices eran los defectos en las fórmulas de optimización.En cuanto a la tasa de adquisición y la retención, no hay evidencia fiable de que el Algoritmo SM-4 supusiera avance alguno. La ligera mejora bien podría deberse a la mejora general del software y a la mejora en los principios de formulación de elementos

Restos de SuperMemo 4 en los nuevos SuperMemos

Curiosamente, todavía se puede ver la matriz de intervalos óptimos en las versiones más recientes de SuperMemo. El algoritmo ya no utiliza la matriz; sin embargo, se muestra en las estadísticas de SuperMemo porque informa al usuario sobre el impacto de la complejidad en las perspectivas de los elementos en el proceso de aprendizaje.

Si comparas una matriz producida por SuperMemo 5 en 8 meses de uso, notarás una similitud significativa con una matriz producida tras dos décadas de uso del Algoritmo SM-8:

Figura: La matriz de intervalos óptimos ya no se utiliza en el Algoritmo SM-17. Sin embargo, aún puede generarse con los procedimientos del Algoritmo SM-15. Las columnas corresponden a la facilidad del material expresada como A-Factor. Las filas corresponden a la estabilidad de la memoria expresada como categoría de repetición

Algoritmo SM-4

A continuación, el esquema del Algoritmo SM-4 tal como se describe en mi tesis de máster:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

Algoritmo SM-4 usado en SuperMemo 4.0:

  1. Divide el conocimiento en los elementos más pequeños posibles
  2. Asocia a todos los elementos un E-Factor igual a 2.5
  3. Tabula la matriz OI para distintos números de repetición y categorías de E-Factor
  4. Usa el siguiente espaciamiento de repeticiones para obtener la matriz OI inicial:OI(1,EF):=1OI(2,EF):=6para n>2 OI(n,EF):=OI(n-1,EF)*EFdonde:
    • OI(n,EF) – intervalo óptimo entre repeticiones tras la n-ésima repetición (en días) para elementos con E-Factor igual a EF,
  5. Usa la matriz OI para determinar los intervalos entre repeticiones:I(n,EF):=OI(n,EF)donde:
    • I(n,EF) – el n-ésimo intervalo entre repeticiones para un elemento cuyo E-Factor es igual a EF (en días),
    • OI(n,EF) – la entrada de la matriz OI correspondiente a la n-ésima repetición y al E-Factor EF
  6. Después de cada repetición, estima la calidad de la respuesta de la repetición en la escala de 0 a 5 (véase el Algoritmo SM-2).
  7. Después de cada repetición, modifica el E-Factor del elemento recién repetido según la fórmula:EF’:=EF+(0.1-(5-q)*(0.08+(5-q)*0.02))donde:
    • EF’ – nuevo valor del E-Factor,
    • EF – valor anterior del E-Factor,
    • q – calidad de la respuesta en la escala de 0 a 5.
    Si EF es menor que 1.3, entonces haz que EF sea 1.3.
  8. Después de cada repetición, modifica la entrada correspondiente de la matriz OI.
  9. Una fórmula de ejemplo podría ser la siguiente (la fórmula realmente usada en SuperMemo 4 era más compleja):OI’:=interval+interval*(1-1/EF)/2*(0.25*q-1)OI :=(1-fraction)*OI+fraction*OI’donde:
    • OI – nuevo valor de la entrada OI,
    • OI’ – valor auxiliar de la entrada OI usado en los cálculos,
    • OI – valor anterior de la entrada OI,
    • interval – intervalo usado antes de la repetición en cuestión (es decir, el último intervalo usado para el elemento dado),
    • fraction – cualquier número entre 0 y 1 (cuanto mayor sea, más rápidos serán los cambios en la matriz OI),
    • EF – E-Factor del elemento repetido,
    • q – calidad de la respuesta en la escala de 0 a 5.
    Nótese que para q=4 la OI no cambia y que para q=5 la OI aumenta 4 veces menos de lo que disminuye para q=0.Nótese también que el cambio máximo de la OI es igual a (I(n)-I(n-1))/2 en términos del espaciamiento de repeticiones usado en el Algoritmo SM-2 (es decir, (OI-OI/EF)/2).
  10. Si la calidad de la respuesta fue inferior a 3, reinicia las repeticiones del elemento desde el principio sin cambiar el E-Factor.
  11. Después de cada sesión de repetición de un día determinado, repite de nuevo todos los elementos que hayan obtenido menos de cuatro en la evaluación de calidad. Continúa las repeticiones hasta que todos estos elementos alcancen al menos cuatro

Problemas con la matriz de intervalos

Además de la lenta convergencia, el Algoritmo SM-4 mostró que el uso de la matriz de intervalos genera varios problemas que podrían resolverse fácilmente sustituyendo los intervalos por O-factors. Estos defectos adicionales llevaron a una rápida implementación del Algoritmo SM-5 ya en 1989. Aquí tenemos un breve análisis que explicaba los defectos del uso de la matriz de intervalos óptimos:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

  • En el curso de la repetición puede ocurrir que uno de los intervalos se calcule más corto que el anterior. Esto es, sin duda, incoherente con las premisas generales del método SuperMemo. Además, la validez de tal resultado quedó refutada por los resultados de la aplicación del Algoritmo SM-5. Este defecto podría evitarse impidiendo que los intervalos aumenten o disminuyan más allá de ciertos valores, pero tal enfoque ralentizaría enormemente el proceso de optimización, interrelacionando los intervalos óptimos mediante dependencias superfluas. El caso analizado se observó, de hecho, en una de las bases de datos. La discrepancia no se eliminó al final del periodo en que se usó el Algoritmo SM-4, a pesar de que los intervalos en cuestión eran de solo dos semanas
  • Los E-Factors de los distintos elementos se modifican constantemente, por lo que en la matriz OI un elemento puede pasar de una categoría de dificultad a otra. Si el número de repetición de ese elemento es suficientemente alto, esto provocará graves alteraciones en el proceso de repetición de ese elemento. Nótese que cuanto mayor sea el número de repetición, mayor será la diferencia entre los intervalos óptimos en columnas de categorías de E-Factor vecinas. Así, si el E-Factor aumenta, el intervalo óptimo usado para el elemento puede resultar artificialmente largo, mientras que en la situación contraria el intervalo puede ser demasiado corto

El Algoritmo SM-4 intentó relacionar la duración del intervalo óptimo con el número de repetición. Este enfoque parece incorrecto porque es mucho más probable que la memoria sea sensible a la duración del intervalo entre repeticiones aplicado anteriormente que al número de la repetición.

SuperMemo 5

La idea de la matriz de intervalos óptimos nació el 11 de febrero de 1989. El 1 de marzo de 1989, empecé a usar SuperMemo 4 para aprender esperanto. Muy pronto noté que la idea necesitaba revisión. La convergencia del algoritmo era terriblemente lenta.

Para el 5 de mayo, ya tenía una nueva idea en mente. Esto fue, en esencia, el nacimiento de la función de aumento de estabilidad, salvo que, en el repaso óptimo de SuperMemo, no habría dimensión de recuperabilidad. El nuevo algoritmo usaría la matriz de factores óptimos. Recordaría cuánto necesitan aumentar los intervalos en función de la complejidad de la memoria y la estabilidad de la memoria actual. La lenta convergencia del Algoritmo SM-4 también inspiró la necesidad de aleatorizar los intervalos (20 de mayo).

Mientras tanto, el progreso tuvo que retrasarse de nuevo por las obligaciones escolares. Junto con Krzysztof Biedalak, decidimos escribir un programa para elaborar pruebas escolares que pudiera usarse con SuperMemo. El proyecto se usó de nuevo para escabullirnos de otras obligaciones en las clases del abierto Dr. Katulski, que a estas alturas ya se había convertido en un defensor de todo lo relacionado con SuperMemo.

Pasé el verano en unas prácticas en los Países Bajos, donde el progreso era lento debido a diversas obligaciones. Una de las principales razones de la lentitud fue una dieta extrema resultante de la necesidad de ahorrar dinero para pagar mis deudas del PC 1512. También esperaba ganar algo extra para comprar un disco duro para mi ordenador. Todo mi trabajo fue posible gracias a la amabilidad de Peter Klijn, de la Universidad de Eindhoven. Simplemente me prestó su PC para uso privado durante todo el periodo de estancia. No quería que mi buen trabajo con SuperMemo se ralentizara. Fue la primera vez que pude guardar todos mis archivos en un disco duro, y se sintió como pasar de una vieja bicicleta a un Tesla Model S.

Solo el 16 de octubre de 1989 se completó el nuevo Algoritmo SM-5 y empecé a usar SuperMemo 5. Anoté en mis notas: » Se avecina una gran revolución«. El progreso fue, en efecto, tremendo.

Tenía un par de usuarios de SuperMemo 2 que estaban dispuestos a actualizarse a SuperMemo 5. Exigí un solo precio: empezarían con la matriz de factores óptimos inicializada a un valor específico. Esto era para validar el algoritmo y asegurarme de que no llevara ningún prejuicio preconcebido. Todas las matrices de optimización preestablecidas convergerían bien y rápido. Este hecho se usó luego para afirmar una convergencia universal, y el algoritmo se describió como tal en la primera publicación jamás escrita sobre algoritmos de repetición espaciada.

Algoritmo SM-5

SuperMemo utiliza un principio sencillo: «usar, verificar y corregir». Tras una repetición, se calcula un nuevo intervalo con la ayuda de la matriz OF. La «entrada relevante» para calcular el intervalo depende de la repetición (categoría) y de la dificultad del elemento. Una vez transcurrido el intervalo, SuperMemo convoca la siguiente repetición. La calificación se usa para indicarle a SuperMemo qué tan bien «funcionó» el intervalo. Si la calificación es baja, tenemos razones para creer que el intervalo es demasiado largo y que la entrada de la matriz OF es demasiado alta. En esos casos, reducimos ligeramente la entrada OF. La entrada relevante aquí es la que se usó previamente para calcular el intervalo (es decir, antes de que empezara el intervalo). En otras palabras, es la entrada que se usa (1) para calcular el intervalo (tras la n-ésima repetición) y luego (2) para corregir la matriz OF (tras la repetición n+1).

A continuación, el esquema del Algoritmo SM-5 tal como se presentó en mi tesis de máster:

Advertencia de archivo: ¿Por qué usar archivos literales?

A continuación se presenta la formulación final del algoritmo usado en SuperMemo 5 (Algoritmo SM-5):

  1. Divide el conocimiento en los elementos más pequeños posibles
  2. Asocia a todos los elementos un E-Factor igual a 2.5
  3. Tabula la matriz OF para distintos números de repetición y categorías de E-Factor. Usa la siguiente fórmula:OF(1,EF):=4para n>1 OF(n,EF):=EFdonde:
    • OF(n,EF) – factor óptimo correspondiente a la n-ésima repetición y al E-Factor EF
  4. Usa la matriz OF para determinar los intervalos entre repeticiones:I(n,EF)=OF(n,EF)*I(n-1,EF)I(1,EF)=OF(1,EF)donde:
    • I(n,EF) – el n-ésimo intervalo entre repeticiones para un elemento de un E-Factor EF dado (en días)
    • OF(n,EF) – la entrada de la matriz OF correspondiente a la n-ésima repetición y al E-Factor EF
  5. Después de cada repetición evalúa la calidad de las respuestas de repetición en la escala de calificación 0-5 (cf. Algorithm SM-2)
  6. Después de cada repetición modifica el E-Factor del elemento repetido recientemente según la fórmula:EF’:=EF+(0.1-(5-q)*(0.08+(5-q)*0.02))donde:
    • EF’ – nuevo valor del E-Factor
    • EF – valor anterior del E-Factor
    • q – calidad de la respuesta en la escala de calificación 0-5
    Si EF es menor que 1.3, entonces establece EF en 1.3
  7. Después de cada repetición modifica la entrada correspondiente de la matriz OF. Fórmulas ilustrativas construidas arbitrariamente y usadas en la modificación podrían verse así:OF’:=OF*(0.72+q*0.07)OF :=(1-fraction)*OF+fraction*OF’donde:
    • OF – nuevo valor de la entrada OF
    • OF’ – valor auxiliar de la entrada OF usado en los cálculos
    • OF – valor anterior de la entrada OF
    • fraction – cualquier número entre 0 y 1 (cuanto mayor sea, más rápidos serán los cambios de la matriz OF)
    • q – calidad de la respuesta en la escala de calificación 0-5
    Nótese que para q=4 el OF no cambia. Aumenta para q>4 y disminuye para q<4.
  8. Si la calidad de la respuesta fue inferior a 3, entonces inicia las repeticiones del elemento desde el principio sin cambiar el E-Factor
  9. Después de cada sesión de repetición de un día determinado, repite de nuevo todos los elementos que hayan obtenido una puntuación inferior a cuatro en la evaluación de calidad. Continúa las repeticiones hasta que todos estos elementos obtengan al menos cuatro

De acuerdo con las observaciones anteriores, no se permitió que las entradas de la matriz OF bajaran de 1.2. En el Algorithm SM-5, por definición, los intervalos no pueden acortarse en repeticiones sucesivas. Los intervalos son al menos 1.2 veces más largos que sus predecesores. Cambiar la categoría de E-Factor aumenta el siguiente intervalo aplicado solo tantas veces como lo requiera la entrada correspondiente de la OF matrix.

Críticas al Algorithm SM-5

El manual de Anki incluye un pasaje sorprendentemente crítico con el Algorithm SM-5 (abril de 2018). Las palabras resultan especialmente sorprendentes porque el Algorithm SM-5 nunca se ha publicado en su totalidad (la versión anterior es solo un esbozo). A pesar de que las críticas se formularon claramente con buena intención, sugieren la posibilidad de que si el Algorithm SM-2 fuera superior al Algorithm SM-5, quizás también lo sea sobre el Algorithm SM-17. Si ese fuera el caso, habría desperdiciado los últimos 30 años de investigación y programación. Hasta el día de hoy, Wikipedia «critica» al «SM3+». «SM3+» es una etiqueta usada por primera vez en el manual de Anki que se ha empleado en docenas de sitios web (especialmente aquellos que prefieren quedarse con el algoritmo más antiguo por su sencillez). Una comparación entre el Algorithm SM-2 y el Algorithm SM-17 se presenta aquí.

Afirmación errónea en el manual de Anki

Mi Master’s Thesis, publicada en extractos en 1998 en supermemo.com, incluía solo una descripción general del Algorithm SM-5. Por razones de claridad, docenas de procedimientos menores no se publicaron. Esos procedimientos requerirían mucho ajuste fino para garantizar una buena convergencia, estabilidad y precisión. Este tipo de ajuste requiere meses de aprendizaje combinados con análisis. Nunca ha existido una versión lista para usar del Algorithm SM-5.

El código fuente del Algorithm SM-5 nunca se ha publicado ni ha sido abierto, y el algoritmo original solo podía probarse por los usuarios de SuperMemo 5, en MS DOS. SuperMemo 5 se convirtió en freeware en 1993. Es importante notar que la dispersión aleatoria de los intervalos alrededor del valor óptimo era esencial para establecer la convergencia. Sin esa dispersión, el progreso del algoritmo habría sido angustiosamente lento. Del mismo modo, el suavizado de la matriz era necesario para un comportamiento consistente independientemente de la riqueza de los datos recopilados para los distintos niveles de estabilidad y complejidad del elemento.

Múltiples evaluaciones realizadas en 1989, y desde entonces, han señalado una superioridad incuestionable del Algorithm SM-5 y de los algoritmos posteriores sobre el Algorithm SM-2 en cualquier métrica estudiada. El Algorithm SM-17 podría de hecho usarse para medir la eficiencia del Algorithm SM-5 si tuviéramos voluntarios para reimplementar ese código antiguo para usarlo con nuestras métricas universales. Ya lo hemos hecho con el Algorithm SM-2 hasta ahora, pues el costo de implementación era insignificante. Ni que decir tiene que el Algorithm SM-2 se queda muy atrás en su poder predictivo, especialmente en niveles subóptimos de retrievability.

Incluso una comprensión básica del modelo subyacente debería dejar claro que una buena implementación produciría beneficios drásticos. SuperMemo 5 adaptaría su función de intervalos a la memoria del usuario. SuperMemo 2 estaba fijo, grabado en piedra. Estoy muy orgulloso de que las conjeturas arriesgadas hechas en 1985 y 1987 resistieran el paso del tiempo, pero ningún algoritmo debería confiar en el juicio de un humilde estudiante con 2 años de experiencia en la implementación de algoritmos de repetición espaciada. En cambio, SuperMemo 4 y todas las implementaciones sucesivas hicieron cada vez menos conjeturas y ofrecieron una adaptabilidad mejor y más rápida. De todas esas implementaciones, solo SuperMemo 4 fue lento en adaptarse y fue reemplazado en 7 meses por una implementación superior.

No hay mala intención en la crítica de Anki, pero no me sorprendería que el autor apostara por una implementación y un avance rápido hacia el autoaprendizaje en lugar de dedicar tiempo a ajustar procedimientos que no parecían funcionar como esperaba. En cambio, allá por 1989, yo sabía que el Algorithm SM-2 era defectuoso, sabía que el Algorithm SM-5 era superior, y no escatimaría tiempo ni esfuerzo en asegurarme de que el nuevo concepto se perfeccionara hasta su máximo potencial teórico.

Extracto del manual de Anki (abril de 2018):

Anki se basó originalmente en el algoritmo SuperMemo SM5. Sin embargo, el comportamiento predeterminado de Anki de revelar el siguiente intervalo antes de responder una tarjeta puso de manifiesto algunos problemas fundamentales del algoritmo SM5. La diferencia clave entre SM2 y las revisiones posteriores del algoritmo es esta:

  • SM2 usa tu desempeño en una tarjeta para determinar el próximo momento de programar esa tarjeta
  • SM3+ usa tu desempeño en una tarjeta para determinar el próximo momento de programar esa tarjeta, y tarjetas similares

El segundo enfoque promete elegir intervalos más precisos al tener en cuenta no solo el desempeño de una sola tarjeta, sino el desempeño como grupo. Si eres muy constante en tus estudios y todas las tarjetas tienen una dificultad muy similar, este enfoque puede funcionar bastante bien. Sin embargo, en cuanto se introducen inconsistencias en la ecuación (tarjetas de dificultad variable, no estudiar a la misma hora cada día), SM3+ es más propenso a conjeturas incorrectas sobre el siguiente intervalo, lo que resulta en tarjetas programadas con demasiada frecuencia o demasiado en el futuro.

Además, dado que SM3+ ajusta dinámicamente la tabla de «factores óptimos», a menudo puede darse una situación en la que responder «difícil» en una tarjeta produzca un intervalo más largo que responder «fácil». Los próximos tiempos están ocultos para ti en SuperMemo, por lo que el usuario nunca es consciente de esto. Después de evaluar las alternativas, el autor de Anki decidió que los intervalos casi óptimos que produce una derivada de SM2 son mejores que intentar obtener intervalos óptimos con el riesgo de conjeturas incorrectas. Un enfoque SM2 es predecible e intuitivo para los usuarios finales, mientras que un enfoque SM3+ oculta los detalles al usuario y requiere que los usuarios confíen en el sistema (incluso cuando el sistema pueda cometer errores en la programación).

Algunos detalles para quien le interese:

  • el hecho de que SuperMemo 5 usara el desempeño pasado de todos los elementos para maximizar el desempeño en los elementos nuevos es una ventaja, no un «problema». Es más, esa es la clave del poder de la adaptabilidad
  • la calificación inconsistente ha sido un problema para todos los algoritmos. En promedio, la adaptabilidad ayuda a averiguar el efecto promedio del mal uso, especialmente si las inconsistencias son consistentes (es decir, si el usuario sigue cometiendo errores similares en circunstancias similares)
  • las dificultades mixtas son manejadas mucho mejor por SuperMemo 5 porque, si bien tanto la dificultad como el aumento de estabilidad se codifican mediante el E-factor en SuperMemo 2, en SuperMemo 5 y versiones posteriores, esas dos propiedades de la memoria se separan
  • las predicciones de intervalos han demostrado ser superiores en SuperMemo 5, y la afirmación «más propenso a conjeturas incorrectas» solo puede explicarse por errores de implementación
  • las calificaciones más bajas podrían producir intervalos más largos si no se implementa el suavizado de la matriz. Esa parte del algoritmo solo se ha descrito verbalmente en mi tesis
  • los intervalos y las fechas de repetición siempre se han mostrado de forma destacada en SuperMemo, incluso en las implementaciones más sencillas (por ejemplo, para dispositivos portátiles, smartphones, etc.). Nada se oculta al usuario. Sobre todo, las estadísticas de forgetting index y burden están a la vista y permiten ver si SuperMemo cumple su promesa de retención y a qué costo en carga de trabajo

De todas las afirmaciones anteriores, solo una podría ser cierta. SuperMemo 2 podría de hecho ser más intuitivo. Este problema ha afectado a SuperMemo durante años. Cada versión es más compleja, y es difícil ocultar parte de esa complejidad a los usuarios. Aun así, seguiremos intentándolo.

Nuestra respuesta oficial, publicada en supermemopedia.com en 2011, parece bastante acertada hoy en día:

Advertencia de archivo: ¿Por qué usar archivos literales?

Es estupendo que Anki introduzca sus propias innovaciones sin dejar de reconocer el mérito de SuperMemo. Es cierto que el Algorithm SM-2 de SuperMemo funciona muy bien en comparación, por ejemplo, con el sistema Leitner o con SuperMemo en papel. Sin embargo, la superioridad del Algorithm SM-5 sobre el SM-2 es incuestionable. Tanto en la práctica como en la teoría. Es el Algorithm SM-2 el que tiene los intervalos fijados de antemano y dependientes solo de la dificultad del elemento, que se aproxima con una fórmula heurística (es decir, una fórmula basada en una conjetura derivada de una experiencia limitada anterior a 1987). Es cierto que no se puede «echar a perder» el Algorithm SM-2 alimentándolo con datos falsos. Esto es así únicamente porque no es adaptable. Probablemente prefieras tu procesador de textos con fuentes personalizables aunque puedas estropear el texto aplicando Wingdings.

El Algorithm SM-2 simplemente multiplica de forma tosca los intervalos por un llamado E-Factor, que es una manera de expresar la dificultad del elemento. En cambio, el Algorithm SM-5 recopila datos sobre el desempeño del usuario y modifica en consecuencia la función de intervalos óptimos. En otras palabras, se adapta al desempeño del estudiante. El Algorithm SM-6 va aún más lejos y modifica la función de intervalos óptimos para lograr un nivel deseado de retención de conocimiento. La superioridad de estos algoritmos más nuevos se ha verificado de más de una manera, por ejemplo, midiendo la disminución de la carga de trabajo a lo largo del tiempo en bases de datos de tamaño fijo. En los casos estudiados (muestra pequeña), la disminución de la carga de trabajo con los algoritmos más nuevos fue casi el doble de rápida en comparación con las bases de datos antiguas procesadas con el Algorithm SM-2 (mismo tipo de material: vocabulario de inglés).

Todos los algoritmos de SuperMemo agrupan los elementos en categorías de dificultad. El Algorithm SM-2 asigna a cada categoría un conjunto rígido de intervalos. El Algorithm SM-5 asigna a cada categoría el mismo conjunto de intervalos también, sin embargo, estos se adaptan en función del desempeño del usuario, es decir, no están grabados en piedra.

La consistencia es, en efecto, más importante en el Algorithm SM-5 que en el Algorithm SM-2, ya que los datos falsos producirán una «adaptación falsa». Sin embargo, siempre es malo dar calificaciones falsas o hacer trampa en SuperMemo, sea cual sea el algoritmo que uses. Con un conocimiento incompleto de la memoria, la adaptabilidad siempre es superior a los modelos rígidos. Por eso sigue siendo mejor adaptarse a un promedio impreciso (como en el Algorithm SM-5) que basar los intervalos en una conjetura imprecisa (como en el Algorithm SM-2). Ni que decir tiene que la última palabra la tiene el Algorithm SM-8 y los posteriores, ya que se adaptan al promedio medido.

Evaluación de SuperMemo 5 (1989)

SuperMemo 5 era tan evidentemente superior que no recopilé muchos datos para demostrar mi punto. Hice solo unas pocas comparaciones para mi Master’s Thesis y no dejaron lugar a dudas.

Advertencia de archivo: ¿Por qué usar archivos literales?

3.8. Evaluación del Algorithm SM-5

El Algorithm SM-5 se ha utilizado desde el 17 de octubre de 1989 y ha superado todas las expectativas al proporcionar un método eficiente para determinar la función deseada de intervalos óptimos y, en consecuencia, al mejorar la tasa de adquisición (15,000 elementos aprendidos en 9 meses). La Fig. 3.5 indica que la tasa de adquisición fue al menos el doble de la indicada por la aplicación combinada de los algoritmos SM-2 y SM-4.

Figura: Cambios en la carga de trabajo en bases de datos supervisadas por los algoritmos SM-2 y SM-5.

La retención de conocimiento aumentó a alrededor del 96% en bases de datos de 10 meses de antigüedad. A continuación se enumeran algunos datos de retención de conocimiento en bases de datos seleccionadas para mostrar la comparación entre los algoritmos SM-2 y SM-5:

  • Date – fecha de la medición,
  • Database – nombre de la base de datos; ALL significa el promedio de todas las bases de datos
  • Interval – intervalo actual promedio usado por los elementos en la base de datos
  • Retention – retención de conocimiento en la base de datos
  • Version – versión del algoritmo aplicado a la base de datos
DateDatabaseIntervalRetentionVersion
Dec 88EVD17 días81%SM-2
Dec 89EVG19 días82%SM-5
Dec 88EVC41 días95%SM-2
Dec 89EVF47 días95%SM-5
Dec 88all86 días89%SM-2
Dec 89all190 días92%SM-2, SM-4 and SM-5

En el proceso de repetición se registró la siguiente distribución de calificaciones:

QualityFraction
00%
10%
211%
318%
426%
545%

Esta distribución, de acuerdo con los supuestos que sustentan el Algorithm SM-5, arroja una calidad de respuesta promedio igual a 4. El forgetting index es igual al 11% (los elementos con calidad inferior a 3 se consideran olvidados). Nótese que los datos de retención indican que solo el 4% de los elementos de una base de datos no se recuerdan. Por lo tanto, el forgetting index supera el porcentaje de elementos olvidados en 2.7 veces. En una base de datos de 7 meses de antigüedad, se encontró que el 70% de los elementos no se habían olvidado ni una sola vez en el transcurso de las repeticiones previas a la medición, mientras que solo el 2% de los elementos se habían olvidado más de 3 veces.

Demostración teórica de la superioridad de los algoritmos más nuevos

La crítica de Anki a SuperMemo 5 exige una demostración sencilla a la luz de la teoría moderna de la repetición espaciada. Podemos mostrar que el modelo actual de la memoria puede mapearse sobre los modelos subyacentes de ambos algoritmos: el Algorithm SM-2 y el Algorithm SM-5, y la diferencia clave entre ambos es la ausencia de adaptabilidad de la función de intervalos óptimos (representada en el Algorithm SM-5 como la Matrix OF).

Sea SInc=f(C,S,R) una función de stability increase que toma como argumentos la complexity C, la stability S y la retrievability R. Esta función determina el aumento progresivo de los intervalos de repaso en el aprendizaje óptimo.

Tanto el Algorithm SM-2 como el SM-5 ignoran la dimensión de retrievability. En teoría, si ambos algoritmos funcionaran perfectamente, podríamos suponer que apuntan a R=0.9. Como puede medirse en SuperMemo, ambos algoritmos fallan en ese esfuerzo porque no conocen las forgetting curves relevantes. Simplemente no recopilan datos de la curva de olvido. Esta función se introdujo recién en el Algorithm SM-6 en 1991.

Sin embargo, si asumimos que las heurísticas de 1985 y 1987 fueron conjeturas perfectas, en teoría, el algoritmo podría usar SInc=F(C,S) con una R constante del 90%.

Debido a que SM-2 usa el mismo número, EF, tanto para el stability increase como para la complexity del elemento, para SM-2 tenemos la ecuación SInc=f(C,S) representada por EF=f'(EF,interval), donde puede demostrarse fácilmente con datos que f<>f’. Sorprendentemente, la heurística usada en SM-2 hizo que esta función funcionara al desacoplar el vínculo real entre el EF y la complejidad del elemento. Como los datos muestran que SInc sigue disminuyendo con S, esto significa que en el Algorithm SM-2, por definición, todos los elementos necesitarían ganar en complejidad con cada repaso si el EF debiera representar la complejidad del elemento. En términos prácticos, el Algorithm SM-2 usa EF=f'(EF,interval), lo que se traduce en SInc(n)=f(SInc(n-1),interval).

Supongamos que la heurística EF=f(EF,interval) fue una conjetura excelente, como afirman los usuarios del Algorithm SM-2. Sea SInc representado por el O-factor en el Algorithm SM-5. Podríamos entonces representar SInc=f(C,S) como OF=f(EF,interval).

Para el Algorithm SM-2, OF sería constante e igual a EF; en el Algorithm SM-5, OF es adaptable y puede modificarse en función del desempeño del algoritmo. Parece bastante obvio que penalizar al algoritmo por un mal desempeño mediante una disminución en las entradas de la matriz OF y recompensarlo por un aumento en las entradas de OF es superior a mantener OF constante.

En una curiosa vuelta de tuerca, tanto como los defensores del Algorithm SM-2 afirman que rinde muy bien, los defensores de la red neuronal de SuperMemo seguían acusando a los algoritmos algebraicos de: falta de adaptabilidad. En realidad, la adaptabilidad del Algorithm SM-17 es la mejor hasta la fecha, ya que se basa en el modelo de memoria más preciso.

Es concebible que las heurísticas usadas en SM-2 fueran tan precisas que la conjetura original sobre OF=f(EF,interval) no necesitara modificación. Sin embargo, como se ha demostrado en la aplicación práctica, la matriz OF evoluciona rápidamente y converge hacia los valores descritos en Wozniak, Gorzelańczyk 1994. Difieren sustancialmente de la suposición codificada en el Algorithm SM-2.

Resumen:

  • hoy: SInc=f(C,S,R), 3 variables, f es adaptable
  • sm5: SInc=f(C,S,0.9), 2 variables, f es adaptable
  • sm2: SInc=f(SInc,S,0.9) – 1 variable, f es fija

Convergencia

El Algorithm SM-5 mostró una convergencia rápida, lo que fue demostrado rápidamente por los usuarios que comenzaron con OF matrices univalentes. Fue todo un contraste con el Algorithm SM-4.

Advertencia de archivo: ¿Por qué usar archivos literales?

3.6. Mejorando la matriz predeterminada de factores óptimos

Los procedimientos de optimización aplicados en las transformaciones de la matriz OF resultaron ser satisfactoriamente eficientes, dando lugar a una convergencia rápida de las entradas de OF hacia sus valores finales.

Sin embargo, en el período considerado (17 de octubre de 1989 – 23 de mayo de 1990), solo aquellos factores óptimos caracterizados por ciclos cortos de modificación-verificación (menos de 3-4 meses) parecen haber alcanzado sus valores de equilibrio.

Pasarán algunos años más antes de que se puedan extraer conclusiones más sólidas sobre la forma definitiva de la matriz OF. El hecho más interesante que se aprecia al analizar matrices OF de 7 meses de antigüedad es que el primer intervalo entre repeticiones debería ser tan largo como 5 días para un E-Factor igual a 2.5 e incluso 8 días para un E-Factor igual a 1.3. Para el segundo intervalo, los valores correspondientes fueron de aproximadamente 3 y 2 semanas respectivamente.

La función de intervalos óptimos recién obtenida podría formularse así:

I(1)=8-(EF-1.3)/(2.5-1.3)*3

I(2)=13+(EF-1.3)/(2.5-1.3)*8

for i>2 I(i)=I(i-1)*(EF-0.1)

donde:

  • I(i) – intervalo tras la i-ésima repetición (en días)
  • EF – E-Factor del elemento considerado.

Para acelerar el proceso de optimización, esta nueva función debería usarse para determinar el estado inicial de la matriz OF (Paso 3 del algoritmo SM-5). Salvo por el primer intervalo, esta nueva función no difiere significativamente de la empleada en los algoritmos SM-0 a SM-5. Se podría atribuir este hecho a las ineficiencias de los procedimientos de optimización que, después de todo, están condicionados por el hecho de aplicar una matriz OF predeterminada. Para asegurarme de que no era así, pedí a tres de mis colegas que usaran versiones experimentales de SuperMemo 5.3 en las que se usaban matrices OF univalentes (todas las entradas iguales a 1.5 en dos experimentos y 2.0 en el experimento restante). Aunque las bases de datos experimentales solo se habían usado durante 2-4 meses, las matrices OF parecen converger lentamente hacia la forma obtenida con el uso de la matriz OF predeterminada. Sin embargo, las matrices OF predeterminadas heredan la correlación artificial entre los E-Factors y los valores de las entradas de OF en la categoría de E-Factor correspondiente (es decir, para n>3 el valor OF(n,EF) está cerca de EF). Este fenómeno no aparece en las matrices univalentes, que tienden a ajustar las matrices OF más estrechamente a los requisitos impuestos por elementos elegidos arbitrariamente del algoritmo, como el valor inicial de los E-Factors (siempre 2.5), la función que modifica los E-Factors tras las repeticiones, etc.

Suavizado de la matriz

Parte de la crítica del autor de Anki podría haber sido resultado de no emplear el suavizado de matriz, que era un componente importante del algoritmo y todavía se usa en el Algorithm SM-17.

Advertencia de archivo: ¿Por qué usar archivos literales?

3.7. Propagación de cambios a través de la matriz de factores óptimos

Habiendo notado las regularidades mencionadas anteriormente en las relaciones entre las entradas de la matriz OF, decidí acelerar el proceso de optimización mediante la propagación de las modificaciones a través de la matriz. Si un factor óptimo aumenta o disminuye, entonces podríamos concluir que el factor OF correspondiente a un número de repetición mayor también debería aumentar.

Esto se deriva de la relación OF(i,EF)=OF(i+1,EF), que es aproximadamente válida para todos los E-Factors e i>2. Del mismo modo, podemos considerar los cambios deseables de los factores si recordamos que para i>2 tenemos OF(i,EF’)=OF(i,EF )*EF’/EF (especialmente si EF’ y EF están lo suficientemente cerca). Usé la propagación de cambios solo en la parte de la matriz OF que aún no había sido modificada por la retroalimentación de las repeticiones. Esto resultó particularmente exitoso en el caso de las matrices OF univalentes aplicadas en las versiones experimentales de SuperMemo mencionadas en el párrafo anterior.

El esquema de propagación propuesto puede resumirse así:

  1. Tras ejecutar el Paso 7 del Algorithm SM-5, localiza todas las entradas vecinas de la matriz OF que aún no se hayan modificado en el curso de las repeticiones, es decir, entradas que no han entrado en el ciclo de modificación-verificación. Las entradas vecinas se entienden aquí como aquellas que corresponden al número de repetición +/- 1 y a la categoría de E-Factor +/- 1 (es decir, E-Factor +/- 0.1)
  2. Modifica las entradas vecinas siempre que no se cumpla alguna de las siguientes relaciones:
    • for i>2 OF(i,EF)=OF(i+1,EF) for all EFs
    • for i>2 OF(i,EF’)=OF(i,EF )*EF’/EF
    • for i=1 OF(i,EF’)=OF(i,EF )
    La relación seleccionada debería cumplirse como resultado de la modificación
  3. Para todas las entradas modificadas en el Paso 2, repite todo el procedimiento localizando sus vecinos aún no modificados.

La propagación de cambios parece ser inevitable si se recuerda que la función de intervalos óptimos depende de parámetros como:

  • la capacidad del estudiante
  • los hábitos de autoevaluación del estudiante (la calidad de la respuesta se otorga según la opinión subjetiva del estudiante)
  • el carácter del conocimiento memorizado, etc.

Por lo tanto, es imposible proporcionar una matriz OF ideal y predeterminada que prescinda del uso del proceso de modificación-verificación y, en menor medida, de los esquemas de propagación.

Dispersión aleatoria de intervalos

Una de las mejoras clave en el Algorithm SM-5 fue la dispersión aleatoria de intervalos. Por un lado, aceleró drásticamente el proceso de optimización; por otro, causó una gran confusión entre los usuarios de casi todas las versiones futuras de SuperMemo: «¿por qué los mismos elementos con la misma calificación usan un intervalo distinto cada vez?». Las desviaciones menores son valiosas. Esto quedó al descubierto cuando se lanzó el Algorithm SM-17 «desnudo» en las primeras versiones de SuperMemo 17. Se pudo observar que los usuarios que mantenían muchas leeches en sus colecciones caían fácilmente en «mínimos locales» de los que nunca podían salir. La dispersión aleatoria se restauró con cierto retraso. El período de «desnudez» fue necesario para observar el algoritmo con precisión, especialmente en un proceso de aprendizaje de varias décadas como el mío.

Advertencia de archivo: ¿Por qué usar archivos literales?

3.5. Dispersión aleatoria de intervalos óptimos

Para mejorar aún más el proceso de optimización, se introdujo un mecanismo que puede parecer contradecir el principio del espaciado óptimo de repeticiones. Reconsideremos un fallo importante del Algorithm SM-5: una modificación de un factor óptimo solo puede verificarse en cuanto a su corrección después de que se cumplan las siguientes condiciones:

  • el factor modificado se usa en el cálculo de un intervalo entre repeticiones
  • el intervalo calculado transcurre y se realiza una repetición que arroja una calidad de respuesta que posiblemente indique la necesidad de aumentar o disminuir el factor óptimo

Esto significa que incluso un gran número de instancias usadas en la modificación de un factor óptimo no lo cambiarán significativamente hasta que el valor recién calculado se use en la determinación de nuevos intervalos y se verifique tras su transcurso.

El proceso de verificación de los factores óptimos modificados, tras el período necesario para aplicarlos en las repeticiones, se llamará más adelante el ciclo de modificación-verificación. Cuanto mayor sea el número de repetición, más largo será el ciclo de modificación-verificación y mayor la ralentización del proceso de optimización.

Para ilustrar el problema de la restricción de modificación, consideremos los cálculos de la Fig. 3.4.

Se puede concluir fácilmente que para la variable INTERVAL_USED mayor que 20, el valor de MOD5 será igual a 1.05 si QUALITY es igual a 5. Como QUALITY=5, MODIFIER será igual a MOD5, es decir, 1.05. Por lo tanto, el nuevo valor propuesto del factor óptimo (NEW_OF) solo puede ser un 5% mayor que el anterior (NEW_OF:=USED_OF*MODIFIER). Por lo tanto, el factor óptimo modificado nunca superará el límite del 5% a menos que USED_OF aumente, lo que equivale a aplicar el factor óptimo modificado en el cálculo de los intervalos entre repeticiones.

Teniendo esto en cuenta, decidí permitir que los intervalos entre repeticiones difirieran de los óptimos en ciertos casos para eludir la restricción impuesta por un ciclo de modificación-verificación.

Llamaré dispersión al proceso de modificación aleatoria de los intervalos óptimos.

Si se permite que una pequeña fracción de los intervalos sea más corta o más larga de lo que debería derivarse de la matriz OF, entonces estos intervalos desviados pueden acelerar los cambios de los factores óptimos permitiendo que caigan o aumenten más allá de los límites del mecanismo presentado en la Fig. 3.4. En otras palabras, cuando el valor de un factor óptimo es muy diferente del deseado, su cambio accidental causado por intervalos desviados no será nivelado por el flujo de repeticiones estándar, porque las calidades de respuesta más bien promoverán el cambio que actuarán en su contra.

Otra ventaja de usar intervalos distribuidos alrededor de los óptimos es la eliminación de un problema que a menudo fue motivo de quejas por parte de los usuarios de SuperMemo: la irregularidad del calendario de repeticiones. Por irregularidad del calendario de repeticiones me refiero a la acumulación de trabajo de repetición en ciertos días mientras los días vecinos quedan relativamente descargados. Esto se debe al hecho de que los estudiantes a menudo memorizan una gran cantidad de elementos en una sola sesión, y estos elementos tienden a permanecer juntos en los meses siguientes, separándose solo en función de sus E-Factors.

La dispersión de los intervalos alrededor de los óptimos elimina el problema de la irregularidad. Consideremos ahora las fórmulas que aplicaba el software SuperMemo más reciente para la dispersión de intervalos en proximidad al valor óptimo. Los intervalos entre repeticiones que difieren ligeramente de los considerados óptimos (según la matriz OF) se llamarán intervalos casi óptimos. Los intervalos casi óptimos se calcularán según la siguiente fórmula:

NOI=PI+(OI-PI)*(1+m)

donde:

  • NOI – intervalo casi óptimo
  • PI – intervalo previamente usado
  • OI – intervalo óptimo calculado a partir de la matriz OF (cf. Algorithm SM-5)
  • m – un número perteneciente al rango <-0.5,0.5> (véase más abajo)

o usando el valor de OF:

NOI=PI*(1+(OF-1)*(1+m))

El modificador m determinará el grado de desviación respecto al intervalo óptimo (desviación máxima para valores de m=-0.5 o m=0.5 y ninguna desviación para m=0).

Para encontrar un equilibrio entre la optimización acelerada y la eliminación de la irregularidad, por un lado (ambas requieren un espaciado de repeticiones fuertemente disperso), y la alta retención, por otro (se requiere una aplicación estricta de los intervalos óptimos), el modificador m debería tener un valor cercano a cero en la mayoría de los casos.

Se usaron las siguientes fórmulas para determinar la función de distribución del modificador m:

  • la probabilidad de elegir un modificador en el rango <0,0.5> debería ser igual a 0.5: integral desde 0 hasta 0.5 de f(x)dx=0.5
  • se asumió que la probabilidad de elegir un modificador m=0 era cien veces mayor que la probabilidad de elegir m=0.5: f(0)/f(0.5)=100
  • se asumió que la función de densidad de probabilidad tenía una forma exponencial negativa con parámetros a y b, que se hallarían a partir de las dos ecuaciones anteriores: f=a*exp(-b*x)

Las fórmulas anteriores arrojan valores a=0.04652 y b=0.09210 para m expresado en porcentaje.

A partir de la función de distribución

integral desde -m hasta m de a*exp(-b*abs(x))dx = P (P denota probabilidad)

podemos obtener el valor del modificador m (para m>=0):

m=-ln(1-b/a*P)/b

Así, el procedimiento final para calcular el intervalo casi óptimo es el siguiente:

a:=0.047;

b:=0.092;

p:=random-0.5;

m:=-1/b*ln(1-b/a*abs(p));

m:=m*sgn(p);

NOI:=PI*(1+(OF-1)*(100+m)/100);

donde:

  • random – función que produce valores del rango <0,1) con una distribución de probabilidad uniforme
  • NOI – intervalo casi óptimo
  • PI – intervalo previamente usado
  • OF – entrada pertinente de la matriz OF

1990: fórmula universal para la memoria

Repaso óptimo frente a repaso intermitente

Para 1990, no me quedaba ninguna duda. Tenía en mis manos un gran descubrimiento. Había descifrado el problema del olvido. Conocía el momento óptimo de repaso para memorias simples. Una vez que aseguré el permiso para describir mis hallazgos en mi Master’s Thesis, mi apetito por el descubrimiento no dejaba de crecer. Esperaba poder encontrar una fórmula universal para la memoria a largo plazo. Una fórmula que me ayudara a rastrear el comportamiento de la memoria para cualquier patrón de exposición o recuperación.

Ya tenía una colección de datos que podía ayudarme a encontrar la fórmula. Antes de descubrir el espaciado óptimo de las repeticiones en 1985, usaba páginas de preguntas para repasar conocimientos. El repaso era caótico y estaba determinado por la disponibilidad de tiempo, la necesidad o el estado de ánimo. A eso lo llamé » aprendizaje intermitente«. Tenía datos de recuerdo para páginas individuales y para cada repaso. Ese era el tipo ideal de datos, que no tenía la periodicidad de SuperMemo. Exactamente el tipo de datos necesario para resolver el problema de la memoria. Sin embargo, solo tenía esos datos en papel.

En la primavera de 1990, recluté a mi hermana para que hiciera la tarea de mecanografiar. No. No tengo una hermana menor que hiciera eso con gusto. Mi hermana era 17 años mayor que yo. Siendo un poco desconsiderado con su tiempo, aproveché su cariño para hacerla trabajar como una mula. Me siento culpable por ello. Murió apenas dos años después. Nunca tuve la oportunidad de devolverle su contribución a la teoría de la repetición espaciada, que ella nunca llegó siquiera a entender. A partir del 1 de mayo de 1990, ella aprovechó mi tiempo lejos de la computadora para transferir los datos del papel a la computadora. Le llevó muchos días de mecanografía lenta. Valió la pena.

Modelo de aprendizaje intermitente

A lo largo del verano de 1990, en lugar de centrarme en mi Master’s Thesis, trabajé en el » modelo de aprendizaje intermitente«. No era raro que trabajara 10 horas seguidas, o que me fuera a dormir a las 7 de la mañana con las manos vacías, o que dejara la computadora procesando números durante toda la noche.

La persistencia y el ajuste fino dan sus frutos. Solo los adolescentes pueden permitírselo y deberían tener el espacio y la libertad para ello. A pesar de tener 28 años, en casa se me toleraba bastante bien. Como a un adolescente inmaduro. Vivía en el apartamento de mi hermana, donde podía aprovecharme de su amabilidad. Las largas horas frente a la computadora se justificaban como » trabajar en mi Master’s Thesis«. La verdad era que nadie me lo pedía, nadie lo exigía, ni siquiera hacía avanzar mucho a SuperMemo. Era pura curiosidad científica. Solo quería saber cómo funciona la memoria.

Tenía docenas de páginas de preguntas y su historial de repeticiones. Intenté predecir los «lapsos de memoria por página». Usé la desviación cuadrática media para la predicción de lapsos (denotada abajo como Dev

). El 10 de julio de 1990, martes, alcancé Dev<3 y sentí que el problema estaba casi «resuelto». El 12 de julio de 1990, mejoré a Dev=2.877 (curiosamente, mi tesis habla de 2.887241). Sin embargo, para el 27 de agosto de 1990, declaré el problema irresoluble. Mis notas de ese día dicen:

Anécdota personal. ¿Por qué usar anécdotas?

27 de agosto de 1990: Resolví el problema del aprendizaje intermitente demostrando que es irresoluble. Un solo parámetro no puede describir la fuerza de la memoria relacionada con toda una página de elementos. Esto demuestra que no existen intervalos óptimos para elementos con E-factors bajos!

El 30 de agosto de 1990, describí el modelo para mi Master’s Thesis. El texto abarcaba 15 páginas que no son precisamente una buena lectura. Apostaría a que nadie ha tenido nunca la paciencia de leerlo todo. Ese capítulo ni siquiera se publicó en supermemo.com cuando mi Master’s Thesis se publicó en línea en extractos a finales de los años 90.

Sin embargo, las conclusiones extraídas a partir del modelo tuvieron un efecto profundo en mi forma de pensar sobre la memoria en las décadas siguientes. Toda la idea detrás del modelo recuerda, de hecho, a las optimizaciones usadas para desarrollar el Algorithm SM-17 (2014-2016).

Cuando declaré el problema irresoluble, quería decir que no podía describir con precisión la memoria de las «páginas difíciles», ya que los materiales heterogéneos requieren modelos más complejos. Sin embargo, las notas del 31 de agosto de 1990 suenan mucho más optimistas:

Anécdota personal. ¿Por qué usar anécdotas?

31 de agosto de 1990: Trabajo sin parar en el modelo de aprendizaje intermitente. Por la noche, la computadora no logró acercarme a la solución. Sin embargo, tuve una gran idea: calcular los intervalos óptimos usando la función de récords del modelo IL. Cuando vi los resultados en la pantalla, no podía creer lo que veían mis [bleep] ojos. Eran exactamente los mismos intervalos que encontré en 1985 al intentar formular el método SuperMemo. Estaba feliz como un perro con dos colas, saltando por toda la casa. Así que puedo decir que realmente resolví el problema del IL (compárese con el 27 de agosto de 1990). Pero este éxito no fue todo lo que se me reveló ese día. Descubrí que:

[…] mis fórmulas solo funcionan cuando los intervalos no son mucho más cortos que la fuerza anterior.

Pasado (1990) vs. Presente (2018)

Las conclusiones al final del capítulo y el propio procedimiento recuerdan a la metodología que utilicé en 2005 cuando buscaba la fórmula universal para el aumento de la estabilidad de la memoria y, más tarde, en 2014, cuando el Algoritmo SM-17 se basó en una descripción matemática de la memoria mucho más precisa. Al igual que el algoritmo más reciente de SuperMemo, el modelo permitía calcular la retención para cualquier calendario de repeticiones. Naturalmente, era mucho menos preciso, ya que se basaba en datos inferiores. Además, lo que SuperMemo 17 hace en tiempo real, en 1990 requería muchas horas de cálculos.

Esta antigua sección de mi tesis de máster, aparentemente aburrida, ha ganado importancia con el paso del tiempo. Me atrevo a decir que solo unos datos inferiores separaban aquel trabajo del Algoritmo SM-17, que surgiría 25 años después. Cito el texto con pequeñas mejoras de notación y estilo, sin el capítulo sobre las curvas de olvido, que era erróneo debido al material altamente heterogéneo utilizado en los cálculos:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » por Piotr Wozniak (1990)

Modelo de aprendizaje intermitente

El modelo de SuperMemo proporciona una base para el cálculo de los intervalos óptimos que deben separar las repeticiones en el proceso de aprendizaje óptimo en el tiempo.

Sin embargo, no permite predecir los cambios en las variables de memoria si las repeticiones se realizan en intervalos irregulares.

A continuación presento un intento de ampliar el modelo de SuperMemo para que pueda utilizarse en la descripción del proceso de aprendizaje intermitente.

En el Capítulo 3, mencioné la forma en que había aprendido inglés y biología antes de que se desarrollara el algoritmo SM-0.

Los datos recopilados durante ese periodo (1982-1984) proporcionan una excelente base para la construcción del modelo de aprendizaje intermitente. Los ítems, formulados de acuerdo con el principio de información mínima (normalmente en forma de pares de palabras), se agrupaban en páginas sujetas a un proceso de repetición irregular. Los datos recopilados, disponibles en formato legible por ordenador, incluyen la descripción de las repeticiones de 71 páginas y, además, 80 páginas similares que participaron en un proceso supervisado por el calendario SM-0.

Similitud con el Algoritmo SM-17

Obsérvese que la formulación del problema recuerda al procedimiento utilizado para calcular la matriz de aumento de estabilidad (SInc[]) en el Algoritmo SM-17. La estabilidad de la memoria se reescaló para poder interpretarla como un intervalo. Incluso los símbolos son similares: S y la desviación D, y los lapsos de página sustituyendo a R.

Me encantaba experimentar con distintos algoritmos de optimización. Todavía se puede observar visualmente en SuperMemo 17 cómo el algoritmo ejecuta optimizaciones de ajuste de superficie (véase la imagen). Hacerlo con 12 variables quizá fuera algo ineficiente, pero nunca me preocupó el método siempre que obtuviera resultados interesantes que aportaran nuevas perspectivas sobre el funcionamiento de la memoria.

Para quienes estén familiarizados con el Algoritmo SM-17, cambiamos la notación en el texto que sigue. Además, símbolos como In y Ln podían confundirse fácilmente en la impresión con logaritmos.

Lista de cambios:

  • Ln -> Laps n
  • In -> Int n
  • Dn -> Dev n
  • R -> RepNo

Formulación del problema del aprendizaje intermitente

Advertencia de archivo: ¿Por qué usar archivos literales?

11.1. Formulación del problema del aprendizaje intermitente

  1. Hay 161 páginas.
  2. Cada página contiene unos 40 ítems.
  3. Para cada página, la descripción del proceso de aprendizaje (recopilada durante las repeticiones experimentales) tiene la siguiente forma:
  4. Int i – intervalo entre repeticiones utilizado antes de la i-ésima repetición (oscila entre 1 y 800),
  5. Laps i – número de lapsos de memoria durante la i-ésima repetición (oscila entre 0 y 40),
  6. n – número total de repeticiones (oscila entre 3 y 20).
  7. Hallar las funciones f y g descritas por las fórmulas:
  8. S(n) – cualquier variable correspondiente a la fuerza de la memoria tras la n-ésima repetición (compárese el Capítulo 10),
  9. Int n – intervalo utilizado antes de la n-ésima repetición; tomado de los datos recopilados durante el aprendizaje intermitente,
  10. Laps n – número de lapsos de memoria en la n-ésima repetición; tomado de los datos recopilados durante el aprendizaje intermitente,
  11. Laps(n) – estimación del número de lapsos de memoria en la n-ésima repetición (debe corresponder con Laps n)
  12. S1 – una constante,
  13. Dev – función que describe la diferencia entre los valores obtenidos por las funciones f y g, y los valores recopilados durante el aprendizaje intermitente (refleja la diferencia entre los datos experimentales y los predichos teóricamente)
  14. RepNo – número total de repeticiones registradas en todas las páginas
  15. Dev i – componente de la función Dev que describe la desviación de la i-ésima página,
  16. Laps(j) – número de lapsos calculado para la i-ésima página y la j-ésima repetición mediante las funciones f y g,
  17. Laps j – número de lapsos de memoria para la i-ésima página y la j-ésima repetición; tomado de los datos recopilados durante el aprendizaje intermitente,
  18. sqrt(x) – raíz cuadrada de x,
  19. sqr(x) – segunda potencia de x.

Obsérvese que las funciones f y g solo proporcionarán una base para consideraciones biológicas valiosas si son simples y están definidas por un número limitado de parámetros (por ejemplo, a*ln()+b o a*exp()+b, etc.). De lo contrario, siempre se podría construir una fórmula gigantesca y sin sentido para reducir Dev a cero automáticamente.

Solución al problema del aprendizaje intermitente

Advertencia de archivo: ¿Por qué usar archivos literales?

11.2. Solución al problema del aprendizaje intermitente

En la búsqueda de las funciones f y g que minimizan el valor de Dev, utilicé un procedimiento numérico de minimización descrito en Wozniak, 1988b [ A new algorithm for finding local maxima of a function within the feasible region. Credit paper ].

Las funciones utilizadas a modo de ejemplo en la búsqueda podrían tener el siguiente aspecto:

S(1)=x[1]

S(n)=x[2]*Int n*exp(-Laps n*x[3])+x[4])

Laps(n)=x[5]*(1-exp(-Int n/S(n-1)))


donde:

  • x[i] – variables calculadas por el procedimiento de minimización,
  • S(n), Laps(n), Laps n e Int n – tal como se definen en 11.1.

Nótese que la función f que describe S(n) no utiliza S(n-1) como argumento (la formulación del problema permite, pero no exige, que la nueva fuerza se calcule a partir de la fuerza anterior).

Para conservar la simplicidad y ahorrar tiempo, fijé un límite de 12 variables utilizadas en el proceso de minimización.

Probé una amplia gama de funciones matemáticas construidas de acuerdo con intuiciones obvias sobre la memoria (por ejemplo, que con el paso del tiempo aumentará el número de lapsos de memoria).

Estas incluían funciones exponenciales, logarítmicas, de potencia, hiperbólicas, sigmoidales, en forma de campana, polinómicas y combinaciones razonables de las anteriores.

En la mayoría de los casos, el procedimiento de minimización redujo el valor de Dev a menos de 3, y las funciones f y g adoptaron una forma similar con independencia de su naturaleza.

El valor más bajo de Dev obtenido con menos de 12 variables fue 2,887241.

Las funciones f y g fueron las siguientes:

constant S(1)=0.2104031;

function Sn(Intn,Lapsn,S(n-1));
begin
   S(n):=0.4584914*(Intn+1.47)*exp(-0.1549229*Lapsn-0.5854939)+0.35;
   if Lapsn=0 then
       if S(n-1)>In then
           S(n):=S(n-1)*0.724994
       else
           S(n):=Intn*1.1428571;
end;

function Lapsn(Intn,S(n-1));
var quot;
begin
   quot:=(Intn-0.16)/(S(n-1)-0.02)+1.652668;
   Lapsn:=-0.0005408*quot*quot+0.2196902*quot+0.311335;
end;

Sin cambiar significativamente el valor de Dev, estas funciones pueden convertirse fácilmente a la siguiente forma:

S(1)=1

para Int n>S(n-1): S(n)=1.5*Int n*exp(-0.15*Laps n)+1

Laps(n)=Int n/S(n-1)

Obsérvese que:

  • se eliminaron o redondearon determinados elementos de la función siempre que la operación no afectara considerablemente al valor de Dev,
  • la fuerza se reescaló para permitir su interpretación como un intervalo en el que el número de lapsos es igual a 1 y el índice de olvido es igual al 2,5% (hay 40 ítems por página y 1/40=2,5%),
  • la fórmula de la fuerza solo es válida si Int n no es mucho menor que S(n-1). Esto se debe a que el valor S(n-1) debe usarse en el cálculo de S(n) si el número de lapsos es bajo, por ejemplo, para Int n<=S(n-1): S(n)=S(n-1)*(1+0.5/(1-exp(S(n-1))*(1-exp(-Int n)))

La función g no incluía S(n-1) intencionadamente, para evitar la acumulación recursiva de errores en los cálculos de repeticiones sucesivas (nótese que la fórmula utilizada no tiene en cuenta el historial del proceso),

  • las fórmulas no pueden usarse para describir ningún proceso en el que los intervalos sean muchas veces más largos que los óptimos. Esto se debe a que, para Int n->?, el valor de Laps(n) supera el 100%,
  • las fórmulas describen el aprendizaje de ítems colectivos caracterizados por una distribución más o menos uniforme de E-Factors. Por lo tanto, no puede utilizarse de forma universal para ítems de dificultad variable.

Por ahora, las fórmulas anteriores constituyen la mejor descripción del proceso de aprendizaje intermitente, y en adelante se denominarán modelo de aprendizaje intermitente (modelo IL, para abreviar).

Simulaciones basadas en el modelo de aprendizaje intermitente

Con la fórmula hallada anteriormente, pude ejecutar toda una serie de experimentos de simulación que me ayudarían a responder a muchos escenarios hipotéticos sobre el comportamiento de la memoria en diversas circunstancias. Esas simulaciones marcaron el rumbo de SuperMemo durante muchos años. En particular, el equilibrio entre la carga de trabajo y la retención desempeñó un papel importante en la optimización del aprendizaje a partir de SuperMemo 6 (1991). Hasta el día de hoy, es el índice de olvido (o la recuperabilidad) el criterio orientador en el aprendizaje, y no el aumento de la estabilidad de la memoria, intuitivamente natural, que puede darse en niveles más bajos de recuerdo. El nivel establecido de lapsos de memoria desempeñó el papel del índice de olvido a continuación.

Advertencia de archivo: ¿Por qué usar archivos literales?

11.4. Verificación del modelo de aprendizaje intermitente

Para verificar la coherencia del modelo de aprendizaje intermitente con la teoría de SuperMemo, intentemos calcular los intervalos óptimos que deberían separar las repeticiones.

El intervalo óptimo vendrá determinado por el momento en que el número de lapsos alcance un valor seleccionado Laps o.

El algoritmo procede de la siguiente manera:

  1. i:=1
  2. S(i):=1
  3. Hallar Int(i+1) tal que Laps(i+1) sea igual a Laps o. Usar la fórmula:
    Int(n)=Laps o*S(n-1) (tomada del modelo IL)
    donde: Int(n) denota el intervalo óptimo n-1.
  4. i:=i+1
  5. S(i):=1.5*Int(i)*exp(-0.15*Laps o)+1 (tomado del modelo IL)
  6. ir a 3

Si Laps o es igual a 2,5 ( índice de olvido 6,25%) y se utiliza la variante exacta del modelo de aprendizaje intermitente, puede observarse una correspondencia asombrosa (compárese con el experimento presentado en la página 16, Capítulo 3.1):

  • Rep – número de la repetición
  • Interval – intervalo óptimo que precede a la repetición, determinado por Laps o=2,5 con base en el modelo IL,
  • Factor – factor óptimo igual al cociente entre el intervalo óptimo y el intervalo óptimo utilizado anteriormente,
  • SM-0 – intervalo óptimo calculado con base en los experimentos que condujeron al algoritmo SM-0
RepIntervalFactorSM-0
21,81
37,84,367
416,82,1516
530,41,8035
650,41,66
780,21,59
81241,55
91901,53
102881,52
114361,51
126541,50
139811,50
1414621,49
1521791,49
1632471,49
1748381,49
1872091,49

Obviamente, la exactitud de esta correspondencia es, hasta cierto punto, una coincidencia, ya que el experimento que condujo a la formulación del algoritmo SM-0 no era tan sensible.

Vale la pena señalar que los factores óptimos tienden a disminuir gradualmente! Este hecho parece confirmar observaciones recientes basadas en el análisis de la matriz de factores óptimos utilizada en el algoritmo SM-5.

Si Laps o es igual a 4 ( índice de olvido 10%, como en el algoritmo SM-5), la secuencia de factores óptimos se asemeja a una columna de la matriz OF del algoritmo SM-5. Además, la retención de conocimiento coincide de forma casi ideal con la observada en las bases de datos de SM-5.

RepIntervalRetentionFactor
2393,21678
31693,809464,89
44393,971842,74
510294,040832,39
623294,068862,27
751794,084182,23
8113894,092562,20
9250294,097372,20
10548194,099672,19

El valor de retención se obtuvo promediando su valor calculado para cada día del proceso óptimo:

R=(R(1)+R(2)+…+R(n))/n

R(d)=100-2.5*Laps(d-dlr)


donde:

  • R – retención media
  • R(d) – retención en el d-ésimo día del proceso
  • Laps(Int) – número esperado de lapsos tras el intervalo I
  • dlr – día del proceso en que se programó la última repetición

Equilibrio entre carga de trabajo y retención

A pesar de las imprecisiones derivadas del material heterogéneo, pudieron extraerse conclusiones sólidas sobre el impacto del índice de olvido en la cantidad de tiempo que hay que invertir en el aprendizaje. Esas observaciones han superado la prueba del tiempo:

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » por Piotr Wozniak (1990)

Pueden extraerse conclusiones muy interesantes al comparar los datos de retención y carga de trabajo calculados mediante el modelo de aprendizaje intermitente:

  • Index – índice de olvido (Laps o*2,5) que determina los intervalos óptimos en el proceso de aprendizaje óptimo en el tiempo programado con el modelo IL
  • Retention – retención global obtenida al utilizar el índice de olvido indicado (calculada tras transcurrir 10.000 días)
  • Repetitions – número de repeticiones programadas en los primeros 10.000 días del proceso al utilizar el índice de olvido indicado,
  • Factor – valor asintótico del factor óptimo (tomado del día 10.000 del proceso)
IndexRetentionRepetitionsFactor
2,597,76cada 2 días1,0000
4,596,88651,0300
5,096,64301,1600
5,596,39221.3000
6.2596.01171.4900
7.595.37131.7700
10.094.10102.1900
12.592.7892.4700

La figura 11.2 demuestra que el índice de olvido utilizado en la determinación de los intervalos óptimos debería situarse en el rango del 5 al 10%.

Fig. 11.2. Compromiso entre carga de trabajo y retención: Por un lado, si el índice de olvido es inferior al 5%, la carga de trabajo aumenta drásticamente sin afectar sustancialmente a la retención. Por otro lado, por encima de un índice de olvido del 10%, la carga de trabajo apenas cambia mientras que la retención cae de forma constante. Obviamente, el compromiso entre carga de trabajo y retención corresponde directamente al equilibrio entre la tasa de adquisición y la retención. Al aumentar la disponibilidad de tiempo X veces (disminuyendo la carga de trabajo X veces), se puede aumentar la tasa de adquisición X veces (comparar Capítulo 5). Nótese que la relación entre el índice de olvido y la retención en este modelo es casi lineal. (fuente: Optimization of learningModel of intermittent learning Piotr Wozniak, 1990)

Otra observación importante surge del cálculo del índice de olvido para el cual el aumento de la fuerza es mayor.

Del modelo de aprendizaje intermitente se deduce que

S(n)=1.5*Laps(n)*S(n-1)*exp(-0.15*Laps(n))+1

Al derivar respecto a la variable Laps(n) llegamos a:

S'(n)=1.5*S(n-1)*exp(-0.15*Laps(n))*(1-0.15*Laps(n))

Finalmente, tras igualar a cero, obtenemos:

Laps(n)=7.8

lo cual corresponde a un índice de olvido igual al 20%. Un índice de olvido así equivale a intervalos 2 veces más largos que los óptimos determinados por el índice igual al 10% (como en el Algoritmo SM-5). Sin embargo, no debe olvidarse que es la retención del conocimiento, y no la fuerza de la memoria, el único factor que se intercambia por la carga de trabajo. Por lo tanto, el hallazgo anterior no invalida la validez del Algoritmo SM-5.

Conclusiones: modelo de aprendizaje intermitente

Las conclusiones finales extraídas al final del capítulo han superado la prueba de 3 décadas. Solo la afirmación sobre la forma no exponencial de las curvas de olvido es inexacta. Como todo el modelo se basó en datos heterogéneos, la naturaleza exponencial del olvido no pudo revelarse.

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimization of learning » de Piotr Wozniak (1990)

Resumen provisional

  • Se construyó el modelo de aprendizaje intermitente para poder estimar la retención de conocimiento bajo distintos calendarios de repetición
  • El modelo indica claramente que la curva de olvido no es exponencial [ incorrecto: véase Exponential nature of forgetting]
  • El modelo se corresponde satisfactoriamente con los datos experimentales
  • Con una precisión sorprendente, el modelo aproxima los intervalos óptimos y la retención de conocimiento implicados por el modelo de SuperMemo
  • El modelo indica que los factores óptimos disminuyen en repeticiones sucesivas y se acercan asintóticamente al valor final
  • El modelo indica que el valor deseable del índice de olvido utilizado en el aprendizaje óptimo en el tiempo debería situarse entre el 5% y el 10%
  • El modelo indica una relación casi lineal entre el índice de olvido y la retención de conocimiento
  • El modelo muestra que el mayor incremento de la fuerza de la memoria ocurre cuando los intervalos son aproximadamente 2 veces más largos que los usados en el método SuperMemo. Esto equivale a un índice de olvido igual al 20%

1991: empleando curvas de olvido

El doloroso nacimiento de SuperMemo World (1991)

1991 fue el año más importante desde el nacimiento de SuperMemo. Fue un año de grandes decisiones, estrés, drama, descubrimiento y trabajo duro. Al comienzo del año había tres grandes creyentes en SuperMemo: BiedalakMurakowski y yo mismo. Todos estábamos en el mismo punto de nuestras vidas: pasando de los años despreocupados de la universidad a la incertidumbre de la vida adulta independiente. Por defecto, todos soñábamos con la gran ciencia en Estados Unidos: Biedalak soñaba con la inteligencia artificial, Murakowski con la física cuántica, y yo quería descifrar los secretos de la memoria molecular. En retrospectiva, los estudiantes de posgrado del Bloque del Este con buenos expedientes, resultados de exámenes y recomendaciones sólidas eran bastante bienvenidos en Estados Unidos. Las cosas se complican más si exigen apoyo financiero completo. Yo no tenía un centavo. Además, a los orientales entusiastas a menudo se les trataba como mano de obra diligente. El celo por sus propios proyectos y grandes ideas podía ser menos bienvenido. Nunca lo sabré. Los tres creyentes tenían visiones distintas para SuperMemo.

El 3 de enero de 1991 comencé la implementación del nuevo algoritmo de repetición espaciada para SuperMemo 6. Ese mismo día, Murakowski partió hacia Londres, donde perseguiría sus sueños educativos mientras intentaba vender SuperMemo 2. No lo vendería a través de un canal de distribución ni en una tienda. Tendría que ir de persona en persona, explicar los méritos del programa y, con suerte, recaudar algo de dinero para mantener viva la esperanza.

Mientras tanto, Biedalak y yo nos reuníamos regularmente para correr 10 km, combinado con natación de invierno y una sesión de lluvia de ideas de camino a casa. Hablábamos sobre todo de estudiar en Estados Unidos y de vender SuperMemo. Cada vez con más frecuencia empezaba a surgir la idea de tener nuestra propia empresa.

Comencé mi trabajo sobre el nuevo algoritmo de repetición espaciada con algunas ideas que cambiarían SuperMemo para siempre. El Algoritmo SM-6 usado en SuperMemo 6 fue un avance que impulsaría el desarrollo posterior durante los siguientes 25 años. Retomaría el sencillo procedimiento experimental que dio lugar a la repetición espaciada en 1985 pero lo haría de forma automatizada. Recogería datos de rendimiento y elegiría el mejor momento para repasar: trazaría la curva de olvido del usuario. Esto también significaría que el usuario podría decidir la probabilidad aceptable de olvido para cada elemento individual (es decir, el nivel óptimo del compromiso entre retención y carga de trabajo).

En aquel momento, yo seguía atado a los disquetes de 360 kB. Por esa razón, SuperMemo todavía no podía conservar todos los historiales de repetición que replicarían por completo el enfoque de 1985 a gran escala. Sin embargo, el 6 de enero de 1990 tuve una idea sencilla. Podía simplemente recopilar datos sobre las curvas de olvido para clases de elementos de distinta dificultad y estabilidad. En lugar del registro completo, solo actualizaría la aproximación de cuántos elementos de una clase determinada se retienen en la memoria en un momento dado (es decir, a un nivel determinado de recuperabilidad). Esa idea sobrevive en el núcleo de SuperMemo hasta el día de hoy. Incluso con el registro completo de historiales de repetición actual, SuperMemo sigue conociendo al instante la recuperabilidad esperada de los elementos de una clase determinada.

En esa encrucijada de la vida, por fin era libre de la escuela. Hay una emoción poderosa que millones de adolescentes y jóvenes adultos enfrentan en sus vidas: un tránsito traumático desde el papel de esclavo llamado «alumno» o «estudiante», hacia la libertad de convertirse en un «adulto desempleado». El impacto psicológico puede ser aún más dramático si se pasa de «buen estudiante» a «desempleado de 28 años que vive con su madre». Como un interruptor de luz: el mundo entero parece pasar de un apoyo alegre a una condena de rostro sombrío mezclada con lástima.

Seguí aprendiendo y trabajando en nuevas ideas para SuperMemo en un ambiente de libertad mezclado con incertidumbre. Para mí, la incertidumbre es un energizante. Sin embargo, el 12 de febrero de 1991 me enteré de que a mi madre le habían diagnosticado un cáncer terminal. A la mezcla de libertad e incertidumbre se añadió una sensación de desolación. Para mí, la desolación también puede ser un energizante. Tripliqué mi aprendizaje sobre el cáncer como si esperara encontrar por mi cuenta alguna terapia mágica. Esto muestra cómo un optimismo poco razonable puede ser clave para la productividad y para sobrevivir a los momentos difíciles. Trabajando más duro podía disipar la desolación. La alta productividad es un antidepresivo seguro. Mi arduo trabajo no dejaba espacio para pensamientos oscuros. ¡Estaba convencido de que curaría a mi madre!

Por cierto, en el momento del diagnóstico de mi madre, también estaba escribiendo un programa para simular el comportamiento óptimo de la memoria en respuesta al entorno; una forma de demostrar qué matemática haría óptimo el modelo de dos componentes de la memoria. Tras el diagnóstico, abandoné ese esfuerzo para dedicarme a aprender sobre el cáncer. Nunca completé ese programa, y esa idea sigue en el limbo, relegada por otros proyectos.

El 6 de marzo de 1991, durante uno de nuestros días de carrera y lluvia de ideas con Biedalak, alguien lanzó el nombre SuperMemo World. Poco sabíamos que cuatro meses después ese sería el nombre de nuestra empresa, que hoy ha sobrevivido 27 años.

El 12 de marzo de 1991 hice mis primeras repeticiones con el nuevo algoritmo en SuperMemo 6 mientras mi madre descansaba en su lecho de muerte. Una semana después, murió apaciblemente mientras dormía a la temprana edad de 70 años. En circunstancias similares, el cuadro habitual incluye reuniones familiares, luto, funeral, y todo un conjunto de tradiciones con raíces religiosas que nunca pude aceptar como racionales. En cambio, 9 horas después de la muerte de mi madre, trabajé en un método mejor para una aproximación rápida de la matriz OF. En ese trabajo, aproveché lo que una vez hice para el ZX Spectrum. Emplearía regresión lineal a lo largo de las columnas de dificultad y regresión exponencial negativa a lo largo de las filas de repetición. Años después descubrí que la regresión potencial es más apropiada para esto último. Solo el Algoritmo SM-8, desarrollado cuatro años más tarde, aprovecharía plenamente esas ideas. Sin embargo, lo menciono sobre todo para ilustrar cómo el trabajo duro y la productividad pueden funcionar muy bien como remedio contra la desolación y una posible depresión. En aquel momento descubrí que el impacto de un trauma emocional sigue una curva circadiana. Trabajaba duro por la mañana, pero la desolación volvía a colarse en mi mente por la noche. El sueño era la liberación y el mejor antidepresivo. Desde aquellos primeros días soy un firme creyente en la idea de que el sueño y el aprendizaje llevan consigo una solución al problema de la depresión, aunque nunca tuve realmente la oportunidad de trabajar en ello. Ayudaría si yo mismo hubiera sufrido un poco, pero o bien tengo una buena dotación de resiliencia, o, más probablemente, empleo instintivamente las herramientas del buen sueño y la alta productividad en tiempos difíciles. Desde que Sapolsky llamó a la depresión la «peor enfermedad del mundo», quise encontrar una fórmula para prevenirla. Presiento que existe una fórmula sencilla. ¿Quizás ese optimismo infantil e ingenuo sea en sí mismo parte de la solución?

El 13 de abril de 1991 decidimos que SuperMemo 2 debía lanzarse como freeware. Esperábamos que pudiera educar a posibles usuarios en el extranjero sobre el poder de la repetición espaciada. Sin embargo, al principio tuvimos que enviar disquetes con el SuperMemo gratuito a nuestra propia costa. Solo en 1993 subimos SuperMemo a un BBS local llamado «Onkonet». Pasarían algunos años más antes de poder subir versiones futuras a Simtel y a sitios de freeware. Esa idea del freeware tuvo un efecto colateral interesante: al final del año quedó claro que la gente empezaría a usar el programa y luego lo abandonaría. Esta fue una pista de un problema inherente a la repetición espaciada: la mala motivación resultante de habilidades deficientes producía una alta tasa de abandono. También oímos que otros intentaban vender SuperMemo 2 como si fuera un producto comercial.

El 2 de mayo de 1991 implementé la opción de establecer el índice de olvido solicitado en SuperMemo 6. El 5 de julio de 1991 nació SuperMemo World. Una de las primeras inversiones fue un PC con disco duro que finalmente me ayudaría a alejarme de la lenta era de los disquetes.

El 23 de noviembre de 1991: SuperMemo fue anunciado como finalista del concurso Software for Europe. Esto salvó a SuperMemo World.

El lento inicio del SuperMemo comercial

Cuando fundamos SuperMemo World con Krzysztof Biedalak el 5 de julio de 1991, el futuro se veía tan brillante que necesitábamos gafas de sol. La tierra está poblada por una población altamente inteligente que necesita aprender cosas. Toda esa población es nuestro mercado. El único problema era cómo convencer a toda esa gente inteligente de que dos estudiantes pobres educados tras el Telón de Acero tenían algo de valor que ofrecer. No podíamos haber usado la web para esa tarea. SuperMemo es más antiguo que la propia web. No podíamos permitirnos publicidad por falta de capital. No existía una cultura de capital de riesgo en Polonia en 1991. Todo lo que pudimos hacer fue poner las primeras copias de SuperMemo en carpetas de archivo y colocarlas en las estanterías de las tiendas de informática cercanas. Como aspirábamos a la dominación global, ni siquiera teníamos un manual en polaco. En lugar de las primeras ventas, tuvimos un largo verano de silencio y dudas crecientes.

Figura: En 1991, nosotros entregamos las primeras copias de SuperMemo 5 para DOS a tiendas de Poznan (Polonia) en carpetas rosas con una pegatina. El manual no incluía traducción al polaco. Sorprendentemente, encontramos algunos compradores. La primera venta tuvo lugar entre el 9 y el 11 de septiembre de 1991 (tienda de informática Axe Prim)
(reconstruido a partir de carpetas y pegatinas originales)

¿Por qué fue difícil vender la primera copia? Puedo reconstruir el escenario a partir de las palabras de uno de nuestros primeros clientes, que en efecto visitó una tienda y echó un vistazo al primer SuperMemo expuesto en público. En un estante con programas informáticos, junto a cajas brillantes de Microsoft, notó una carpeta desaliñada con palabras tentadoras: » Su software de aprendizaje rápido revolucionario «. Tomó la carpeta y abrió un manual, que era un montón de páginas mal fotocopiadas en inglés. Con palabras grandilocuentes, leyó una historia que desafiaba la credulidad. Todo era demasiado bueno para ser verdad. Aprendizaje más rápido, gran retención, nuevo método científico, poco coste en tiempo, etc. No contempló la inversión, el paquete era bastante costoso (unos 100 dólares, mucho dinero en la Polonia de 1991); sin embargo, se acercó al vendedor para averiguar quiénes eran las personas detrás de SuperMemo. El dueño de la tienda conocía bastante bien SuperMemo y se lo explicó. La historia empezó a parecer creíble. El cliente nunca olvidó ese episodio. Unos meses después, oyó hablar de SuperMemo en alguna revista local y se convirtió en uno de los primeros clientes de pago. Su cupón de registro llegó en enero de 1992, y el historial de sus actualizaciones dice que permaneció con SuperMemo durante décadas, y ahora su hijo es uno de los clientes habituales.

Sin embargo, en el verano de 1991 no teníamos ventas, y para el otoño todos excepto yo empezaron a tener serias dudas. No sobre SuperMemo, sino sobre la viabilidad del negocio.

Debería ayudar saber cómo nos conocimos. Con Biedalak, éramos amigos desde siempre. Estudié en un colegio con su hermano, vivíamos a 200 metros de distancia y entramos en el mismo año de informática en la universidad. No puedo decir cómo convencí a Biedalak de que SuperMemo era genial. Simplemente habíamos estado demasiado unidos y él siempre había formado parte del círculo. Esta parte fue fácil. Tomek Kuehn fue uno de los primeros grandes creyentes en SuperMemo. También era un gran programador, una gran inspiración, y comprendió la idea al instante. Él mismo escribió dos versiones de SuperMemo: para Atari 800 en 1988, y para Atari ST en 1989. En enero de 1989 incluso vendió 10 copias de SuperMemo 2 usando un anuncio en una de las revistas de informática: Komputer. Supongo que no recuperó el dinero invertido. Al graduarse, ya tenía su propio negocio: una tienda de informática. Esta tienda fue también una de las primeras en presentar SuperMemo a sus clientes. Su socio y amigo era Marczello Georgiew, a quien tampoco hizo falta convencer mucho. Por último, pero no menos importante, conocí a Janusz Murakowski durante los exámenes GRE en Budapest en 1990. Una gran mente matemática; puede que sea el converso más rápido a SuperMemo de la historia. Durante nuestro viaje en tren de vuelta a Polonia, mencioné SuperMemo. Quedó cautivado al instante. Unos días después ya era un entusiasta usuario de SuperMemo 2 (desde el 13 de junio de 1990). En el himno rap de nuestra empresa cantábamos » somos los chicos que venden SuperMemo«. Era muy difícil convencer a la gente de que SuperMemo funcionaba, pero los chicos del equipo siempre fueron entusiastas.

Para noviembre de 1991, el entusiasmo se estaba enfriando. Si hubiéramos continuado sin éxito, habríamos ido perdiendo al equipo en proporción a su implicación y pasión. Con unos meses más, la empresa podría haber muerto. SuperMemo no habría muerto. Yo ciertamente habría buscado un comprador, o habría continuado de una forma u otra. Estaba demasiado ligado al producto. Lo usaba yo mismo y todo mi conocimiento estaba invertido en mis bases de datos. Podría haber pensado en retomar la idea de un doctorado en Estados Unidos. De la misma forma que pude combinar el trabajo en la universidad de Holanda en 1989 con la programación «fuera de horas», probablemente habría continuado hasta algún avance, por ejemplo en la web. ¿Quizás habría sido un producto de código abierto? Por suerte, el Dr. Wojciech Makałowski, del Departamento de Bioquímica de Biopolímeros, sugirió que presentáramos SuperMemo al concurso Software for Europe. Por un golpe de suerte milagroso, clasificamos para la final, y esto fue notado de inmediato por los medios polacos, especialmente las revistas de informática. A partir de ese punto, SuperMemo tuvo un camino fácil con la prensa polaca, cada vez más intrigada. Andrzej Horodeński fue el primero, y Pawel Wimmer fue el segundo y el más fiel hasta el día de hoy. Wimmer efectivamente usó SuperMemo 2, que probablemente recibió de Tomasz Kuehn en la época de su anuncio en la revista KOMPUTER en 1989.

1,5 años después de su nacimiento, SuperMemo World finalmente se había vuelto rentable. Nada mal.

SuperMemo World fue una configuración fantástica desde el principio. No tuvimos ninguna inyección de capital de riesgo en Polonia en 1991, así que tuvimos que levantarnos con nuestro propio esfuerzo vendiendo lo que otros consideraban «aceite de serpiente». Podríamos haber fracasado fácilmente, pero sobrevivimos por la pura fuerza de la pasión, la fe y una gran dosis de buena suerte.

Orígenes del Algoritmo SM-6

El Algoritmo SM-6 se usó por primera vez en SuperMemo 6 (1991), aunque siguió evolucionando en SuperMemo 7 (1992). Nunca existió una versión SM-7 pese a los múltiples cambios. Cabe destacar que, a partir de 1994, se usó la función exponencial para aproximar las curvas de olvido en SuperMemo 7 para Windows. Las aproximaciones de la matriz OF también se han mejorado con el tiempo.

Figura: SuperMemo 7 para Windows (1992) mostrando una curva de olvido basada en promedios.

Figura: SuperMemo 7 para Windows (1994) mostrando una curva de olvido aproximada mediante una función exponencial. El eje vertical representa el recuerdo en porcentaje. El eje horizontal corresponde al tiempo representado por el Factor U

El componente más importante del Algoritmo SM-6 era recopilar datos sobre la tasa de olvido. Las curvas de olvido facilitan determinar con precisión los intervalos óptimos. Esto eliminó la necesidad del enfoque lento e impreciso de «bang-bang» del Algoritmo SM-5:

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Este texto forma parte de: » Economics of Learning » de Piotr Wozniak (1995)

En el Algoritmo SM-5, el proceso de determinar el valor de una sola entrada de la matriz de factores óptimos se veía así (véase antes):

  1. Establecer el valor inicial en un valor promedio de factor óptimo (OF) obtenido en experimentos previos
  2. Si la calificación producida por la entrada en cuestión era (1) mayor que el valor deseado, entonces aumentar el valor de OF, (2) menor que el valor deseado, entonces disminuir OF, o (3) igual al valor deseado, entonces no cambiar OF

El enfoque anterior muestra que el valor óptimo de OF solo podía alcanzarse tras un gran número de repeticiones y, lo peor, cuanto mayor era el número ordinal de una repetición, más tiempo se tardaba en ejecutar el ciclo de modificación-verificación (es decir, el ciclo en el que una entrada OF se modifica y se verifica al programar otra repetición con un intervalo correspondientemente largo).

Introduciendo el concepto de índice de olvido

La novedad del Algoritmo SM-6 es aproximar la pendiente de la curva de olvido correspondiente a una entrada dada de la matriz de factores óptimos, y calcular el nuevo valor del factor óptimo relevante directamente a partir de la curva aproximada. En otras palabras, no se necesita ningún ciclo de modificación-verificación en el Algoritmo SM-6 porque se establece una relación determinista entre la curva de olvido y el intervalo óptimo entre repeticiones. La modificación del factor óptimo ocurre inmediatamente después de una repetición, al aproximar la nueva curva de olvido derivada de datos que incluyen la calificación proporcionada en la respuesta más reciente. Esta modificación no solo permitió acelerar en gran medida el proceso de determinar los valores óptimos de la matriz de factores óptimos, sino que también proporcionó un medio para establecer el nivel deseado de retención de conocimiento que se alcanzará en el curso del proceso de aprendizaje (véase un ejemplo de curva de olvido).

El nivel deseado de retención de conocimiento se determina por la proporción de elementos que no se recuerdan en las repeticiones. Esta proporción se denomina índice de olvido (los elementos se clasifican como recordados u olvidados según las calificaciones proporcionadas por el estudiante en la autoevaluación de su progreso).

Figura: Un ejemplo de curva de olvido trazada en el curso de repeticiones (con más de 40.000 casos de repetición registrados).

En la figura presentada arriba, el transcurso del tiempo está representado por el intervalo en días. El eje vertical representa la retención de conocimiento expresada como porcentaje. La línea horizontal situada en el nivel de retención del 90% determina el índice de olvido solicitado, es decir, la proporción deseada de elementos que deberían olvidarse en el momento de la repetición. El intervalo óptimo surgirá entonces de forma natural en el punto de intersección de la línea del índice de olvido solicitado con la curva de olvido. En el ejemplo anterior, el intervalo óptimo equivale a siete días. La curva de olvido presentada se trazó a partir de 40489 casos de repetición registrados. Véase más adelante en el texto la explicación de los valores R-Factor (RF), O-Factor (OF), etc. Debido a la naturaleza altamente irregular de la matriz de factores óptimos calculada directamente a partir de curvas de olvido, en el Algoritmo SM-6, la matriz utilizada para espaciar las repeticiones representa una versión suavizada de la llamada matriz de factores de retención (matriz RF), que se deriva directamente de las curvas de olvido correspondientes a entradas concretas de la matriz OF. En otras palabras, las curvas de olvido determinan el valor de las entradas de la matriz RF, y solo el equivalente suavizado de esta última, la matriz OF, se usa para calcular los intervalos óptimos.

Algoritmo SM-6

La descripción del algoritmo a continuación está tomada, con algunas aclaraciones, de mi tesis doctoral, y se refiere al estado de las cosas en 1994:

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Este texto forma parte de: » Economics of Learning » de Piotr Wozniak (1995)

  1. El conocimiento aprendido se divide en las piezas más pequeñas posibles llamadas elementos
  2. Los elementos se formulan en forma de pregunta-respuesta
  3. Los elementos se memorizan mediante una técnica de abandono autoguiada, es decir, respondiendo a las preguntas planteadas tantas veces como sea necesario hasta dar todas las respuestas correctas
  4. Tras memorizar un elemento, la primera repetición se programa después de un intervalo que es el mismo para todos los elementos. Su valor se determina por el nivel deseado de retención de conocimiento, que a su vez puede convertirse en un intervalo usando una curva de olvido promedio tomada de una base de datos promedio de un estudiante promedio ( Wozniak 1994a). La retención deseada se especifica mediante el llamado índice de olvido, que corresponde a la proporción de elementos olvidados en las repeticiones (para aprender a calcular la retención a partir del índice de olvido, y viceversa). Nótese que el primer intervalo puede acortarse o alargarse aleatoriamente para acelerar el proceso de optimización (variar los intervalos aumenta la precisión de la aproximación de la curva de olvido).
  5. El primer intervalo se calcula como para un estudiante promedio y una base de datos promedio. Sin embargo, tan pronto como el valor registrado del índice de olvido se desvía del nivel solicitado, la duración del primer intervalo se modifica en consecuencia. El nuevo valor del intervalo se deriva de la aproximación de la curva de olvido negativamente exponencial trazada en el curso de la repetición. Con cada calificación de repetición registrada, el trazado se vuelve cada vez más preciso y el valor utilizado del intervalo óptimo entre repeticiones se estabiliza en el punto que garantiza el nivel seleccionado de retención de conocimiento. Después de cada repetición, el estudiante produce una calificación, que determina la precisión y facilidad de reproducir la respuesta correcta.
  6. A partir de las calificaciones, los elementos se clasifican en categorías de dificultad. Su dificultad se reestima en cada repetición sucesiva. La dificultad de cada elemento se caracteriza por los E-factors mencionados antes (E significa «facilidad», easiness). Los E-factors son iguales a 2.5 para todos los elementos al entrar en el proceso de aprendizaje, y se modifican tras repeticiones sucesivas. Por ejemplo, las calificaciones superiores a cuatro resultan en un ligero aumento del E-factor (las buenas calificaciones indican elementos fáciles), mientras que las calificaciones inferiores a cuatro reducen el E-factor. Históricamente, los E-factors se usaban para determinar cuántas veces debían aumentar los intervalos en repeticiones sucesivas de elementos de una dificultad dada. En la actualidad, los E-factors solo se usan para indexar las matrices de factores óptimos y factores de retención, y pueden tener poca relevancia con el aumento real del intervalo.
  7. Se aplican distintos intervalos óptimos a elementos de distinta dificultad.
  8. Se aplican distintos intervalos a elementos que se han repetido un número diferente de veces.
  9. La función de intervalos óptimos se modifica constantemente para producir la retención de conocimiento deseada, determinada por el índice de olvido. En otras palabras, el algoritmo detectará cómo el estudiante afronta las repeticiones y ajustará en consecuencia la duración de los intervalos entre repeticiones.
  10. La función de intervalos óptimos se representa como la matriz de factores óptimos, matriz OF en resumen, definida de la siguiente manera: para n=1: I(n,EF)=OF(n,EF) para n>1: I(n,EF)=I(n-1,EF)*OF(n,EF) donde:
    • I(n,EF) – n-ésimo intervalo para la dificultad EF
    • OF(n,EF) – factor óptimo para la n-ésima repetición y la dificultad EF
    Las entradas de la matriz de factores óptimos se modifican en el curso de las repeticiones para asegurar el nivel deseado de retención de conocimiento
  11. La matriz de factores óptimos se produce suavizando la llamada matriz de factores de retención, matriz RF en resumen. La matriz de factores de retención se define de la misma manera que la matriz de factores óptimos.
  12. Las entradas de la matriz de factores de retención tienen como fin estimar los valores de las entradas de la matriz de factores óptimos. Cada factor óptimo corresponde a un intervalo óptimo que produce la retención deseada en la repetición (determinada por el índice de olvido solicitado). Cada entrada de la matriz de factores de retención corresponde a un valor distinto de E-factor y número de repetición
  13. Las entradas de la matriz de factores de retención, llamadas R-factors , se calculan a partir de curvas de olvido cuya forma se esboza a partir del historial de repeticiones
  14. El transcurso del tiempo en el gráfico de la curva de olvido se mide mediante el llamado U-factor , que es el cociente entre el intervalo actual y el anterior, excepto en la primera repetición, donde el U-factor equivale al intervalo en días (como en la Figura). El registro de repeticiones permite calcular la retención para diferentes valores del U-factor. El gráfico de la retención en función del transcurso del tiempo (U-factor) representa una curva de olvido. El punto de intersección de la curva de olvido con el nivel de retención deseado determina el R-factor óptimo, que, al suavizar la matriz de factores de retención, produce el O-factor óptimo
  15. Cada categoría de dificultad y número de repetición tiene su propio registro de repeticiones usado para trazar una curva de olvido independiente. En otras palabras, se usarán distintos intervalos para elementos de distinta dificultad, y para elementos repetidos un número diferente de veces.
  16. Los intervalos usados en el aprendizaje, incluido el primer intervalo, se dispersan ligeramente en torno al valor óptimo para aumentar la precisión del trazado de la curva de olvido y, en consecuencia, aumentar la tasa de convergencia del procedimiento de optimización. Al dispersar ligeramente los intervalos, la aproximación de la curva de olvido usará un conjunto más disperso de puntos en el gráfico

1994: naturaleza exponencial del olvido

Curva de olvido: potencial o exponencial

La forma de la curva de olvido es vital para entender la memoria. Las matemáticas detrás de la curva pueden incluso influir en la comprensión del papel del sueño (véase más adelante). Cuando Ebbinghaus determinó por primera vez la tasa de olvido, obtuvo un conjunto de datos bastante bueno con un buen ajuste a la función potencial. Sin embargo, hoy sabemos que el olvido es exponencial. La discrepancia se explica aquí.

Curva de olvido adaptada de Hermann Ebbinghaus (1885). La curva se ha representado a partir de los datos tabulares originales publicados por Ebbinghaus (Piotr Wozniak, 2017)

Un razonamiento erróneo ayudó a la repetición espaciada

Durante muchos años, la forma real de la curva no jugó un papel importante en la repetición espaciada. Mis primeras intuiciones eran variadas según el contexto. Allá por 1982 pensaba que la evolución había diseñado el olvido para que el cerebro se asegurara de no quedarse sin espacio de memoria. El momento óptimo para el olvido estaría determinado por las propiedades estadísticas del entorno. La decadencia estaría programada para maximizar la supervivencia. Una vez que no se producía el repaso, la memoria se eliminaría para dar espacio a nuevos aprendizajes.

Estaba equivocado al pensar que podía existir un tiempo óptimo para el olvido, y ese error fue en realidad útil para inventar la repetición espaciada. Esa intuición del «tiempo óptimo» ayudó al primer experimento de 1985. El tiempo óptimo para el olvido implicaría una curva de olvido sigmoidal con un claro punto de inflexión que determinara la optimalidad. Antes del repaso, el olvido sería mínimo. Un repaso retrasado resultaría en un olvido rápido. Por eso encontrar el intervalo óptimo parecía tan crítico. Cuando los datos empezaron a llegar más tarde, con mi sesgo de confirmación, aún no podía ver mi error. Escribí en mi tesis de maestría sobre el olvido sigmoidal: » esto se sigue directamente de la observación de que antes de que transcurra el intervalo óptimo, el número de lapsos de memoria es insignificante«. Debo de haber olvidado mi propio gráfico de la curva de olvido producido a finales de 1984.

Hoy esto parece absurdo, pero incluso mi modelo de aprendizaje intermitente proporcionó cierto apoyo a la teoría. La aproximación exponencial arrojó un error de desviación particularmente alto para los datos recopilados en mi trabajo sobre el modelo de aprendizaje intermitente, y la superposición de curvas sigmoidales para diferentes E-Factors podía imitar fácilmente la linealidad temprana. La aproximación lineal parecía ajustarse excelentemente al modelo de aprendizaje intermitente dentro del rango de recuerdo de los datos disponibles. No es de extrañar que, con páginas enteras de material heterogéneo, la naturaleza exponencial del olvido permaneciera bien oculta.

Modelos contradictorios

No reflexioné mucho sobre las curvas de olvido. Sin embargo, mi modelo biológico, que se remonta a 1988, hablaba de decaimiento exponencial en la recuperabilidad. Al parecer, en aquellos días, la curva de olvido y la recuperabilidad podían existir en mi cabeza como entidades independientes.

En mi trabajo para una asignatura de simulación por computadora (Dr. Katulski, enero de 1988), mis figuras muestran claramente curvas de olvido exponenciales:

Figura: Mecanismo hipotético involucrado en el proceso de aprendizaje óptimo. (A) Fenómenos moleculares (B) Cambios cuantitativos en la sinapsis.

Para entonces, quizás ya había tomado la idea mejor de la literatura. En los años 1986-1987 pasé mucho tiempo en la biblioteca universitaria buscando buena investigación sobre repetición espaciada. No encontré ninguna. Es posible que ya conociera la curva de olvido de Ebbinghaus. Se menciona en mi tesis de maestría.

Recopilando datos

Recopilé datos para mi primer gráfico de curva de olvido a finales de 1984. Como todo el aprendizaje se hacía por el placer de aprender a lo largo de 11 meses, y el coste del gráfico era mínimo, me olvidé de ese gráfico, y quedó sin usar durante 34 años en mis archivos:

Figura: Mi primerísima curva de olvido para la retención de vocabulario en inglés, trazada allá por 1984, es decir, unos meses antes de diseñar SuperMemo en papel. Este gráfico no formaba parte del experimento. Era simplemente una evaluación acumulativa de los resultados del aprendizaje intermitente de vocabulario en inglés. El gráfico pronto quedó olvidado. Fue redescubierto 34 años después. Tras memorizar, se repasaron 49 páginas de ~40 pares de palabras en inglés a distintos intervalos y se registró el número de errores de recuerdo. Tras descartar valores atípicos y promediar, la curva resulta ser mucho menos pronunciada que la curva obtenida por Ebbinghaus (1885), en la cual usó sílabas sin sentido y una medida de olvido diferente: el ahorro en el reaprendizaje

Mi experimento de 1985 también podría considerarse un intento ruidoso de recopilar datos de la curva de olvido. Sin embargo, los primeros SuperMemos no se preocupaban por la curva de olvido. La optimización era de naturaleza «bang-bang», aunque hoy recopilar datos de retención parezca una solución tan obvia (como en 1985).

Hasta que comencé a recopilar datos con el software SuperMemo, donde cada elemento podía examinarse de forma independiente, no pude recuperarme por completo de mis primeras nociones erróneas sobre el olvido.

SuperMemo 1 para DOS (1987) recopilaba historiales de repetición completos que permitirían determinar la naturaleza del olvido. Sin embargo, en 10 días (el 23 de diciembre de 1987), tuve que descartar el registro completo de repeticiones. En aquel momento, mi espacio de disco era de 360 KB. Así es. Ejecutaba SuperMemo desde los viejos disquetes de 5,25 pulgadas. El registro completo del historial de repeticiones no volvió a SuperMemo hasta 8 largos años después (15 de febrero de 1996), tras el esfuerzo frenético del Dr. Janusz Murakowski, quien consideraba cada minuto que pasaba un desperdicio de datos valiosos que podrían impulsar futuros algoritmos e investigaciones sobre la memoria. Dos décadas después, tenemos más datos de los que podemos procesar eficazmente.

Sin el historial de repeticiones, aún podía investigar el olvido con la ayuda de datos de curvas de olvido recopilados de forma independiente. El 6 de enero de 1991 descubrí cómo registrar curvas de olvido en un pequeño archivo que no aumentaría el tamaño de la base de datos (es decir, sin el registro completo del historial de repeticiones).

Solo entonces, en 1991, SuperMemo 6 empezó a recopilar datos de curvas de olvido para determinar los intervalos óptimos. Hacía lo mismo que mi primer experimento, salvo que lo hacía automáticamente, a gran escala, y para memorias separadas en preguntas individuales (esto resolvió el problema de heterogeneidad). SuperMemo 6 inicialmente usaba una búsqueda binaria para encontrar el mejor momento correspondiente al índice de olvido. Una buena aproximación por ajuste todavía estaba a 3 años de distancia.

Primeros datos de curva de olvido

En mayo de 1991 tenía algunos datos iniciales para echar un vistazo, y fue una gran decepción. Predije que necesitaría un año para ver alguna regularidad. Sin embargo, cada par de meses seguía anotando mi decepción con el mínimo progreso. El avance en la recopilación de datos fue agónicamente lento y la espera fue insoportable. Un año después, no estaba más cerca del objetivo. Si Ebbinghaus fue capaz de trazar una buena curva con sílabas sin sentido, su dolor por la falta de coherencia debió de haber valido la pena. Con datos significativos, la verdad tardó mucho en emerger. Incluso con la comodidad de que todo lo hiciera un ordenador mientras me divertía aprendiendo.

El 3 de septiembre de 1992, SuperMemo 7 para Windows hizo posible echar el primer buen vistazo a una curva de olvido real. La vista era hipnotizante:

Figura: SuperMemo 7 para Windows se escribió en 1992. Desde el 3 de septiembre de 1992 fue capaz de mostrar el gráfico de la curva de olvido del usuario. El eje horizontal etiquetado como Factor U correspondía a días en este gráfico en particular. Los quiebres entre los días 14 y 20 fueron una de las razones por las que era difícil determinar la naturaleza del olvido. Las viejas hipótesis erróneas eran difíciles de refutar. Hasta el día 13, el olvido parecía casi lineal y también podía ajustarse bien a una exponencial. Tomó dos años más de recopilación de datos encontrar respuestas (fuente: SuperMemo 7: User’s Guide)

Aproximaciones de la curva de olvido

En 1994 todavía no estaba seguro sobre la naturaleza del olvido. Tomé los datos recopilados en los 3 años anteriores (1991-1994) y me propuse averiguar la curva de una vez por todas. Me centré en mis propios datos de más de 200.000 repeticiones. Sin embargo, no fue fácil. Si SuperMemo programa una repetición en R=0.9, se puede trazar una línea recta de R=1.0 a R=0.9 y funcionar muy bien con datos ruidosos:

Figura: Dificultad para aproximar la curva de olvido. Allá por 1994 era difícil entender la naturaleza del olvido en SuperMemo porque la mayoría de los datos se recopilaban en el rango de recuerdo alto.

Mis notas del 6 de mayo de 1994 ilustran el grado de incertidumbre:

Anécdota personal. ¿Por qué usar anécdotas?

6 de mayo de 1994: Todo el día de intentos alocados para aproximar mejor las curvas de olvido. Primero probé con R=1-i n/(H n+i n) donde i – intervalo, H – vida media de la memoria, y n – factor de cooperatividad. Ya entrada la noche, lo conseguí hacer funcionar bastante lento, pero… ¡resultó que r=exp(-a*i) funciona no mucho peor! Incluso la vieja aproximación lineal no era mucho peor (sigmoide: D=8.6%, exponencial D=8.8%, y lineal D=10.8%). ¿Quizás las curvas de olvido son de verdad exponenciales? Me voy a dormir a las 2:50

No fue fácil separar funciones lineales, potenciales, exponenciales, de Zipf, de Hill y otras. Las aproximaciones exponenciales, potenciales e incluso lineales daban resultados bastante buenos según circunstancias difíciles de separar. Solo al observar las curvas de olvido bien ordenadas por complejidad a niveles más altos de estabilidad, a pesar de que esos gráficos tenían pocos datos, pude ver con más claridad la naturaleza exponencial del olvido.

Uno de los señuelos engañosos de 1994 fue que, naturalmente, tenía la mayoría de los datos recopilados para la primera repetición. Los elementos nuevos al entrar en el proceso todavía forman un grupo heterogéneo que obedece a la ley potencial del olvido.

La curva de olvido de la primera repetición para conocimiento recién aprendido, recopilada con SuperMemo.

Más tarde, cuando se ordenan por complejidad y estabilidad, empiezan a volverse exponenciales. En el Algoritmo SM-6, la complejidad y la estabilidad se expresaban de forma imperfecta mediante los E-Factors y el número de repetición respectivamente. Esto resultó en imperfecciones algorítmicas que produjeron una clasificación imperfecta. Además, SuperMemo se mantiene dentro del área de alta retención, donde el olvido es casi lineal.

Para mayo de 1994, la principal curva de primera repetición en mi base de datos de Advanced English había recopilado 18.000 puntos de datos y parecía el mejor material analítico. Sin embargo, esa curva abarca todo el material de aprendizaje que entra en el proceso independientemente de su dificultad. Poco sabía yo que esa curva está cubierta por la ley potencial. Mi mejor desviación fue 2.0.

Para una curva similar de 2018, véase:

Figura: Curva de olvido obtenida en 2018 con SuperMemo 17 para dificultad promedio (A-Factor=3.9). Con 19.315 repeticiones y una desviación de mínimos cuadrados de 2.319, es bastante similar a la curva de 1994, salvo que se aproxima mejor con una función exponencial (para un ejemplo de función potencial véase: curva de olvido).

Prevalece el olvido exponencial

Para el verano de 1994, estaba razonablemente seguro de la naturaleza exponencial del olvido. En 1995 publicamos «2 components of memory» con la fórmula R=exp(-t/S). Nuestra publicación sigue siendo en gran medida ignorada por la ciencia dominante, pero está por toda la web cuando se discuten las curvas de olvido.

Curiosamente, en 1966, el premio Nobel Herbert Simon echó un vistazo a la Ley de Jost, derivada del trabajo de Ebbinghaus en 1897. Simon notó que la naturaleza exponencial del olvido requiere la existencia de una propiedad de la memoria que hoy llamamos estabilidad de la memoria. Simon escribió un breve artículo y siguió adelante con cientos de otros proyectos en los que estaba ocupado. Su texto quedó en gran parte olvidado; sin embargo, fue profético. En 1988, un razonamiento similar llevó a la idea del modelo de dos componentes de la memoria a largo plazo.

Hoy podemos añadir una implicación más: si el olvido es exponencial, implica una probabilidad constante de olvido por unidad de tiempo, lo cual implica interferencia de red neuronal, lo cual implica que el sueño podría construir estabilidad no fortaleciendo las memorias, sino simplemente eliminando la causa de la interferencia: las sinapsis innecesarias. Giulio Tononi podría entonces tener razón sobre la pérdida neta de sinapsis durante el sueño. Sin embargo, él cree que esa pérdida es homeostática. El olvido exponencial indica que podría ser mucho más. Podría ser una forma de » olvido inteligente» de cosas que interfieren con las memorias clave reforzadas durante la vigilia.

Curva de olvido negativamente exponencial

Solo en 2005 escribimos de forma más extensa sobre la naturaleza exponencial del olvido. En un artículo presentado por el Dr. Gorzelańczyk en una conferencia de modelización en Polonia, escribimos:

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Aunque siempre se ha sospechado que el olvido es de naturaleza exponencial, demostrar este hecho nunca ha sido sencillo. El decaimiento exponencial aparece de forma estándar en sistemas biológicos y físicos, desde la desintegración radiactiva hasta el secado de la madera. Ocurre en cualquier lugar donde la tasa de decaimiento esperada sea proporcional al tamaño de la muestra, y donde la probabilidad de decaimiento de una sola partícula sea constante. Los siguientes problemas han dificultado el esfuerzo de modelar el olvido desde los tiempos de Ebbinghaus (Ebbinghaus, 1885):

  • tamaño de muestra pequeño
  • heterogeneidad de la muestra
  • confusión entre curvas de olvido, curvas de reaprendizaje, curvas de práctica, curvas de ahorro, curvas de ensayos hasta aprender, curvas de error, y otras de la familia de curvas de aprendizaje

Empleando SuperMemo, podemos superar todos estos obstáculos para estudiar la naturaleza del decaimiento de la memoria. Como aplicación comercial popular, SuperMemo proporciona un acceso prácticamente ilimitado a enormes cuerpos de datos recopilados de estudiantes de todo el mundo. Los gráficos de la curva de olvido disponibles para todo usuario del programa ( Tools : Statistics : Analysis : Forgetting curves) se trazan sobre muestras de datos relativamente homogéneas y son un reflejo fiel del decaimiento de la memoria en el tiempo (a diferencia de otras formas de curvas de aprendizaje). Sin embargo, la búsqueda de homogeneidad afecta significativamente al tamaño de la muestra. Es importante señalar que las curvas de olvido para material con distinta estabilidad de memoria y distinta dificultad de conocimiento difieren entre sí. Mientras que la estabilidad de la memoria afecta a la tasa de decaimiento, el material de aprendizaje heterogéneo produce una superposición de curvas de olvido individuales, cada una caracterizada por una tasa de decaimiento diferente. En consecuencia, incluso en conjuntos con cientos de miles de piezas individuales de información participando en el proceso de aprendizaje, solo se pueden filtrar muestras de datos relativamente pequeñas y homogéneas. Estas muestras rara vez superan varios miles de casos de repetición. Aun así, estos conjuntos de datos superan con creces la calidad de muestra disponible para los investigadores que estudian las propiedades de la memoria en condiciones controladas. Sin embargo, la naturaleza estocástica del olvido sigue dificultando una postura definitiva sobre la naturaleza matemática de la función de decaimiento (véanse dos ejemplos a continuación). Habiendo analizado varios cientos de miles de muestras, hemos llegado más cerca que nunca de demostrar que el olvido es una forma de decaimiento exponencial.

Figura: Curva de olvido de ejemplo trazada por SuperMemo. La muestra de la base de datos, de casi un millón de casos de repetición, se filtró por dificultad promedio y baja estabilidad (A-Factor=3.9, S en [4,20]), resultando en 5850 casos de repetición (menos del 1% de la muestra completa). La línea roja es el resultado de un análisis de regresión con R=e -kt/S. El ajuste de curvas con otras funciones elementales demuestra que el decaimiento exponencial ofrece el mejor ajuste a los datos. La medida de tiempo usada en el gráfico es el llamado Factor U, definido como el cociente entre el intervalo actual y el anterior entre repeticiones. Nótese que el decaimiento exponencial en el rango de R de 1 a 0.9 puede aproximarse de forma plausible con una línea recta, lo cual no sería el caso si el decaimiento estuviera caracterizado por una función potencial.

Figura: Curva de olvido de ejemplo trazada por SuperMemo. La muestra de la base de datos, de casi un millón de casos de repetición, se filtró por dificultad promedio y estabilidad media (A-Factor=3.3, S > 1 año), resultando en 1082 casos de repetición. La línea roja es el resultado de un análisis de regresión con R=e -kt/S.

Curva de olvido: fórmula de recuperabilidad

En el Algoritmo SM-17, la recuperabilidad R corresponde a la probabilidad de recuerdo y representa la curva de olvido exponencial. La recuperabilidad se deriva de la estabilidad y del intervalo:

R[n]:=exp -k*t/S[n-1]

donde:

Ese pulcro enfoque teórico se vuelve un poco más complejo cuando consideramos que el olvido puede no ser perfectamente exponencial si los elementos son difíciles o de dificultad mixta. Además, las curvas de olvido en SuperMemo pueden verse afectadas por las estrategias del usuario.

En el Algoritmo SM-8 esperábamos que la información de recuperabilidad pudiera derivarse de las calificaciones. Esto resultó ser falso. Existe muy poca correlación entre las calificaciones y la recuperabilidad, y proviene principalmente del hecho de que los elementos complejos reciben peores calificaciones y tienden a olvidarse más rápido (al menos al principio).

Retención vs. el índice de olvido

La naturaleza exponencial del olvido implica que la relación entre el índice de olvido medido y la retención de conocimiento puede expresarse con precisión mediante la siguiente fórmula:

Retention = -FI/ln(1-FI)

donde:

  • Retention – la retención general de conocimiento expresada como fracción (0..1),
  • FI – índice de olvido expresado como fracción (el índice de olvido equivale a 1 menos la retención de conocimiento en las repeticiones).

Por ejemplo, por defecto, una repetición espaciada bien ejecutada debería resultar en una retención de 0.949 (es decir, 94.9%) para un índice de olvido de 0.1 (es decir, 10%). El 94.9% ilustra cuánto se parece el decaimiento exponencial a una función lineal al principio. Para un olvido lineal, la cifra sería 95.000% (es decir, 100% menos la mitad del índice de olvido).

Curva de olvido para material mal formulado

En 1994 tuve la suerte de que mis bases de datos estuvieran en gran medida bien formuladas. Esto no siempre ocurría con los usuarios de SuperMemo. Para elementos mal formulados, la curva de olvido se aplana. No es puramente exponencial (como una superposición de varias curvas exponenciales). SuperMemo nunca puede predecir el momento del olvido de un solo elemento. El olvido es un proceso estocástico y solo puede operar sobre promedios. Una falacia frecuentemente propagada sobre SuperMemo es que predice el momento exacto del olvido: esto no es cierto, y no es posible. Lo que SuperMemo hace es buscar intervalos en los que es probable que los elementos de una dificultad dada muestren una probabilidad determinada de olvido (por ejemplo, 10%). Esas curvas de olvido aplanadas condujeron a una paradoja. Descuidar los elementos complejos puede llevar a una gran supervivencia tras largas pausas de repaso. Incluso para una curva de olvido puramente negativa-exponencial, una desviación de 10 veces en la estimación del intervalo resultará en una diferencia de retención de R2=exp 10*ln(R1). Esto equivale a una caída del 98% al 81%. Para una curva de olvido aplanada, típica de elementos mal formulados, esta caída puede ser tan pequeña como del 98% al 95%. Esto lleva a la conclusión de que mantener el material complejo con prioridades más bajas es una buena estrategia de aprendizaje.

La ley potencial surge de la superposición de curvas de olvido exponenciales

Para ilustrar la importancia de las muestras homogéneas en el estudio de las curvas de olvido, veamos el efecto de mezclar conocimiento difícil con conocimiento fácil en la forma de la curva de olvido. La figura de abajo muestra por qué las muestras heterogéneas pueden llevar a conclusiones erróneas sobre la naturaleza del olvido. ¡La muestra heterogénea de esta demostración se aproxima mejor con una función potencial! El hecho de que las curvas potenciales surjan al promediar curvas de olvido exponenciales ya ha sido reportado por otros (Anderson&Tweney 1997; Ritter&Schooler, 2002).

Figura: La superposición de curvas de olvido puede resultar en el ocultamiento de la naturaleza exponencial del olvido. Se ha compuesto una muestra teórica de dos tipos de rastros de memoria: 50% de los rastros de la muestra con estabilidad S=1 (línea amarilla fina) y 50% de los rastros de la muestra con estabilidad S=40 (línea violeta fina). La curva de olvido superpuesta exhibirá, naturalmente, una recuperabilidad R=0.5*Ra+0.5*Rb=0.5*(e -k*t+e -k*t/40). La curva de olvido de esa muestra compuesta se muestra en negro granulado en el gráfico. La línea azul gruesa muestra la aproximación exponencial (R2=0.895), y la línea roja gruesa muestra la aproximación potencial de la misma curva (R2=0.974). En este caso, es la función potencial la que ofrece el mejor ajuste a los datos, aunque el olvido de los subconjuntos de la muestra es negativamente exponencial.

SuperMemo 17 también incluye una única curva de olvido que se aproxima mejor mediante una función potencial. Es la primera curva de olvido tras memorizar los elementos. En el momento de la memorización no conocemos la complejidad del elemento. Por eso el material es heterogéneo y obtenemos una curva de olvido potencial.

Figura: La curva de olvido de la primera repetición para conocimiento recién aprendido, recopilada con SuperMemo. En este caso se usa la aproximación potencial debido a la heterogeneidad del material de aprendizaje recién introducido en el proceso. La falta de separación por complejidad de la memoria resulta en una superposición de olvido exponencial con distintas constantes de decaimiento. En un gráfico semilogarítmico, la curva de regresión potencial es logarítmica (en amarillo) y parece casi recta. La curva muestra que en el caso presentado el recuerdo cae apenas al 58% en cuatro años, lo cual puede explicarse por un alto reúso del conocimiento memorizado en la vida real. El primer intervalo óptimo para el repaso con una recuperabilidad del 90% es de 3.96 días. La curva de olvido puede describirse con la fórmula R=0.9907*power(interval,-0.07), donde 0.9907 es el recuerdo después de un día, mientras que -0.07 es la constante de decaimiento. En este caso, la fórmula arroja un 90% de recuerdo después de 4 días. Se usaron 80.399 casos de repetición para trazar el gráfico presentado. Se producirá una caída más pronunciada en el recuerdo si el material contiene una mayor proporción de conocimiento difícil (especialmente conocimiento mal formulado), o en estudiantes nuevos con menores habilidades mnemónicas. La irregularidad de la curva en los intervalos 15-20 proviene de una muestra más pequeña de repeticiones (las categorías de intervalos posteriores en una escala logarítmica abarcan un rango más amplio de intervalos)

1995: SuperMemo hipermedia

El nacimiento del Algoritmo SM-8 en una cabaña de montaña

En 1995, SuperMemo se reescribió desde cero, y fue una gran oportunidad para implementar un nuevo algoritmo de repetición espaciada basado en los datos recopilados durante 4 años de uso del Algoritmo SM-6.

En marzo de 1995, en el CeBIT de Hannover, vimos un fantástico nuevo entorno de desarrollo de Borland: Delphi. Elevó el viejo Borland Pascal a un nuevo nivel y abrió docenas de oportunidades de desarrollo para SuperMemo. Decidimos rediseñar el programa siguiendo las líneas descritas en mi tesis doctoral. Además de la repetición espaciada, queríamos tener estructura de conocimiento e hipermedia. En lugar de una masa de elementos, los usuarios construirían un árbol de conocimiento. En lugar de la vieja plantilla de pregunta, respuesta, imagen y sonido, queríamos tener todos los tipos de componentes posibles que pudieran combinarse en nuevas formas hipermedia para expresar el conocimiento. También había un sueño de un SuperMemo programable en el que los desarrolladores pudieran escribir sus propios procedimientos para cualquier forma de entrenamiento, incluyendo entrenamiento de procedimientos, mecanografía táctil, o resolución de ecuaciones cuadráticas. Al mismo tiempo, habíamos recopilado muchos datos que indicaban que el algoritmo usado en SuperMemo podía mejorarse. Por ejemplo, la naturaleza matemática de la matriz de factores óptimos se había vuelto bastante obvia.

En mayo de 1995 llevé mi PC Pentium a una cabaña de montaña remota en el sur de Polonia para trabajar en esas ideas. Fue un período de 100 días de aislamiento total, interrumpido solo por una breve visita de Krzysztof Biedalak, durante la cual resincronizamos nuestra visión para el futuro de SuperMemo. Para septiembre de 1995, el nuevo algoritmo estaba listo y probado con mis propios datos. De vuelta en Poznan, comencé a trasladar gradualmente todo mi proceso de aprendizaje de múltiples colecciones en SuperMemo 7 al nuevo entorno apodado «Genius». Genius se convirtió en SuperMemo 8 solo dos años después, cuando el nuevo programa añadió toda la funcionalidad que originalmente estaba disponible en SuperMemo 7.

Los principales datos que ayudaron a desarrollar el Algoritmo SM-8 fueron las curvas de olvido y los datos de la matriz OF recopilados con SuperMemo 6 y SuperMemo 7. Estos datos eliminaron gran parte de las conjeturas del algoritmo. El trabajo fue bastante sencillo en comparación con el Algoritmo SM-17 (2014-2016), cuando tenía montañas de historiales de repetición que procesar, y los requisitos de precisión y buenas métricas se habían triplicado. Mientras que el Algoritmo SM-17 tardó dos años en desarrollarse, el Algoritmo SM-8 se diseñó, implementó y probó bien en tan solo 100 días.

Las principales ideas detrás del Algoritmo SM-8:

  • determinación matemática precisa de la matriz OF basada en aproximaciones en vivo. En lugar del suavizado de matrices conocido de SuperMemo 5, quería conocer la función matemática exacta que pudiera describir la matriz y realizar actualizaciones en vivo. Fue fácil determinar que una función potencial negativa determinaría OF=f(RepNo) (lo cual es una expresión de SInc=f(S) en términos actuales). Se necesitó algo más de conjetura para el impacto de la dificultad en el aumento de estabilidad (SInc). Opté por una aproximación lineal de la función que relaciona la dificultad ( A-Factor) con la constante de decaimiento para SInc (D-Factor), que expresaba la disminución del aumento de estabilidad con la estabilidad/intervalo. Esa apuesta lineal ha sobrevivido hasta hoy. Fue una buena conjetura.
  • con una buena definición de la matriz OF, pude proporcionar una definición precisa de la dificultad del elemento: en lugar de un E-Factor fluido que podía controlarse manualmente mediante calificaciones al antojo del usuario, quería tener un A-factor de dificultad absoluta, definido como el aumento de estabilidad después de la primera repetición programada para R=0.9. Esto permitió que SuperMemo ajustara la dificultad del elemento con cada repetición corrigiendo el ajuste del rendimiento del elemento con el rendimiento esperado según la matriz OF
  • determinación más rápida de la dificultad inicial correlacionando la primera calificación con el A-factor. Este es un mecanismo débil de poca importancia, como demuestra el hecho de que incluso con historiales de múltiples repeticiones, la dificultad del elemento sigue siendo un concepto impreciso. En ese contexto, se debe recordar a los usuarios que el mejor enfoque es formular bien los elementos y simplemente mantenerlos fáciles
  • aproximación del primer intervalo tras un lapso mediante un ajuste exponencial basado en el número de lapsos de memoria. El mayor valor de ese enfoque fue abolir el mito de que reducir la duración de los intervalos en caso de lapsos de memoria podría acelerar el aprendizaje (algunos autores de software basado en el Algoritmo SM-2 optaron por esa solución, que ha demostrado ser errónea)
  • la idea de correlacionar las calificaciones con el índice de olvido fue un fracaso y no contribuyó a mejorar el algoritmo. Esa verdad se reveló lentamente. Se tardó casi una década en llegar al veredicto final: las calificaciones se correlacionan mal con el índice de olvido. La intuición nacida con el Algoritmo SM-2 es solo débilmente correcta

Curiosamente, el Algoritmo SM-8 no requería el historial completo de repeticiones para los elementos. Los historiales completos de repetición no se implementaron hasta febrero de 1996. La ventaja era una implementación más sencilla. La desventaja radicaba en el hecho de que, una vez que el usuario intervenía manualmente en el proceso de aprendizaje, el algoritmo no tenía registro de esa intervención y no podía defenderse de una posible entrada de datos incorrectos. Naturalmente, solo el registro completo del historial de repeticiones permitió implementar el Algoritmo SM-17 dos décadas después.

Mi primera repetición «en vivo» con el Algoritmo SM-8 sobre mis propios datos tuvo lugar el miércoles 16 de agosto de 1995. Para la prueba, «sacrifiqué» una pequeña colección de 100 elementos con una lista de clavijas mnemotécnica para memorizar números. Durante los dos años siguientes, convertí gradualmente todas mis demás colecciones para que funcionaran con el nuevo algoritmo y en el nuevo entorno SuperMemo. En 1997, todo mi conocimiento finalmente se integró en una única base de datos bien estructurada. En 1995-1997 llamábamos a esa base de datos un «sistema de conocimiento». Hoy simplemente la llamamos colección (como en una colección de piezas de conocimiento).

Hasta el día de hoy, el núcleo del algoritmo nacido en 1995 sigue funcionando en SuperMemo 17 en segundo plano, y el usuario todavía puede elegir intervalos basados en ese algoritmo antiguo en caso de no estar satisfecho con las propuestas del Algoritmo SM-17.

Dificultad absoluta del elemento

En SuperMemo 1.0 hasta SuperMemo 3.0, los E-Factors se definían de la misma manera que los O-Factors (es decir, el cociente de intervalos sucesivos). Eran una medida aproximada de la dificultad del elemento (cuanto mayor el E-Factor, más fácil el elemento). Sin embargo, la optimización de la repetición espaciada forzaba a los E-factors a corresponder con el aumento de estabilidad, que disminuye con la estabilidad. En otras palabras, por definición, en el Algoritmo SM-2, los elementos se etiquetaban como cada vez más «difíciles» a medida que estaban sujetos a repeticiones sucesivas. Esto es un poco contraintuitivo y los usuarios nunca parecieron notarlo.

A partir de SuperMemo 4.0, los E-Factors se usaron para indexar la matriz de O-Factors. Seguían usándose para reflejar la dificultad del elemento. Seguían usándose para calcular los O-Factors. Sin embargo, podían diferir de los O-Factors y así reflejar mejor la dificultad.

En SuperMemo 4 hasta SuperMemo 7, la dificultad del material en una base de datos dada determinaba la relación entre los O-Factors y los E-Factors. Por ejemplo, en una colección fácil, el O-Factor de partida (es decir, el que corresponde a la primera repetición y a la dificultad inicial asumida) sería relativamente alto. Como el rendimiento en las repeticiones determina los E-Factors, elementos de la misma dificultad en una colección fácil naturalmente tendrían un E-Factor más bajo que exactamente los mismos elementos en una colección difícil. Todo esto cambió en SuperMemo 8, donde se introdujeron los A-Factors. Los A-Factors están «vinculados» a la segunda fila de la matriz de O-Factors. Esto los convierte en una medida absoluta de la dificultad del elemento. Su valor no depende del contenido de la colección . Por ejemplo, se sabe que si el A-Factor es 1.5, la tercera repetición tendrá lugar en un intervalo un 50% más largo que el primer intervalo.

Advertencia sobre archivos: ¿Por qué usar archivos literales?

El A-Factor es un número asociado con cada elemento de una colección. El A-Factor determina cuánto aumentan los intervalos en el proceso de aprendizaje. Cuanto mayor el A-Factor, más rápido aumentan los intervalos. Los A-Factors reflejan la dificultad del elemento. Cuanto mayor el A-Factor, más fácil el elemento. Los elementos más difíciles tienen A-Factors iguales a 1.2. El A-Factor se define como el cociente entre el segundo intervalo óptimo y el primer intervalo óptimo usados en las repeticiones

Intervalo posterior al lapso

La aproximación del intervalo posterior al lapso en el Algoritmo SM-8 acabó con dos mitos:

  • acortar los intervalos después de un lapso es una buena idea (esta idea se defendió múltiples veces en los años 1991-2000)
  • el primer intervalo siempre debería ser de 1 día (como en algunas soluciones de SuperMemo más antiguas)

En el gráfico presentado a continuación, podemos ver que con lapsos sucesivos, el intervalo óptimo posterior al lapso se va acortando ligeramente. Esto no expresa otra cosa que el hecho de que esos recuentos altos de lapsos solo se alcanzan con elementos mal formulados, o elementos que son realmente difíciles de recordar por su naturaleza semántica o interferencia de conocimiento. Para las memorias que comienzan con Lapse=10, sugerí el término » tóxica» para expresar su impacto en el proceso de aprendizaje. Si el cerebro rechazó una pieza de información tantas veces, deberíamos recibir un mensaje: este conocimiento está mal formulado o se ha vuelto tóxico por otras razones (por ejemplo, estrés asociado al aprendizaje, como en la escuela).

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Primer intervalo – la duración del primer intervalo después de la primera repetición depende del número de veces que un elemento dado se ha olvidado. Nótese que la primera repetición aquí se refiere a la primera repetición después del olvido, no a la primera repetición de siempre. En otras palabras, un elemento repetido dos veces tendrá el número de repetición igual a uno después de haber sido olvidado; el número de repetición no será igual a tres. El gráfico del primer intervalo muestra una curva de regresión exponencial que aproxima la duración del primer intervalo para diferentes números de lapsos de memoria (incluyendo la categoría de cero lapsos, que corresponde a elementos recién memorizados). En el gráfico de abajo, los círculos azules corresponden a datos recopilados en el proceso de aprendizaje (cuanto mayor el círculo, más repeticiones se han registrado).

Figura: En el gráfico anterior, que incluye datos de más de 130.000 repeticiones, los elementos recién memorizados se repiten de forma óptima después de siete días. Sin embargo, los elementos que han sido olvidados 10 veces (algo poco común en SuperMemo) requerirán un intervalo de dos días. (Debido a la escala logarítmica, el tamaño del círculo no es linealmente proporcional a la muestra de datos; el número de casos de repetición para Lapses=0 es con mucho mayor que para Lapses=10, como puede verse en Distributions : Lapses)

Primera calificación vs. A-Factor

Correlacionar la primera calificación con la dificultad estimada del elemento tenía como fin ayudar a clasificar los elementos por dificultad al entrar en el proceso de aprendizaje. La correlación resulta ser débil y depende en gran medida del sistema de calificación del usuario. Para algunos usuarios, prácticamente no hay correlación (imagen #1). Para otros, la correlación es lo bastante buena como para cubrir todo el rango de dificultad (A-factor) (imagen #2).

Además, en el Algoritmo SM-11, derivado del Algoritmo SM-8, se permitía al usuario ejecutar repeticiones prematuras. Esas repeticiones tendrían en cuenta el efecto de espaciamiento; sin embargo, seguirían contribuyendo al gráfico y sobreestimarían la calificación para los elementos difíciles. Con un uso extensivo de la lectura incremental, esto aplanaría el gráfico.

El Algoritmo SM-17 no usa la correlación calificación-dificultad y deriva la dificultad de todo el historial de repeticiones. La práctica demuestra que incluso entonces la estimación es difícil de hacer, y la buena práctica de aprendizaje consiste en mantener todos los elementos fáciles (es decir, dentro del ajuste mnemotécnico aceptado con el resto del conocimiento del estudiante).

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Primera calificación vs. A-Factor – el gráfico G-AF correlaciona la primera calificación obtenida por un elemento con la estimación final de su valor de A-Factor. En cada repetición, la estimación anterior del A-Factor del elemento actual se elimina del gráfico y se añade la nueva estimación. Este gráfico lo usa el Algoritmo SM-15 para estimar rápidamente el primer valor del A-Factor en el momento en que todo lo que sabemos sobre un elemento es la primera calificación que obtuvo en su primera repetición.

Calificación vs. índice de olvido

Al correlacionar las calificaciones con el índice de olvido esperado ( recuperabilidad predicha), esperaba poder calcular el índice de olvido estimado (estimación posterior a la repetición de la recuperabilidad real). Esta correlación resultó ser débil debido al hecho de que todos los usuarios tienden a implementar sus propios sistemas de calificación, que a menudo son inconsistentes. La correlación entre la calificación y R proviene principalmente del hecho de que los elementos complejos reciben peores calificaciones y tienden a olvidarse más rápido (al menos al principio). En ese sentido, las calificaciones ofrecen un mejor reflejo de la complejidad que de la recuperabilidad.

En la imagen de abajo, todo el rango del índice de olvido esperado parece situarse en torno a la calificación 3.

Para Calificación<=3 podemos leer el índice de olvido estimado máximo, y para Calificación>=4 podemos leer el índice de olvido estimado mínimo. En ese sentido, dos sistemas de calificación tendrían exactamente el mismo efecto en el algoritmo que el sistema de seis calificaciones.

Para otros usuarios, la curva podría incluso alcanzar un pico en ciertos niveles del índice de olvido esperado, como si la calificación reflejara un deseo de recordar elementos que son realmente difíciles de recordar (calificación indulgente).

El Algoritmo SM-17 hace un uso extensivo de la recuperabilidad estimada después de la repetición; sin embargo, la deriva de los datos de recuerdo puros y de la recuperabilidad esperada. También se recopilan las correlaciones calificación-recuperabilidad, aunque su peso es insignificante.

Advertencia sobre archivos: ¿Por qué usar archivos literales?

Calificación vs. índice de olvido – el gráfico FI-G correlaciona el índice de olvido esperado con la calificación obtenida en las repeticiones. Es necesario entender el Algoritmo SM-15 para entender este gráfico. Se puede imaginar que el gráfico de la curva de olvido podría usar la calificación promedio en lugar de la retención en su eje vertical. Si correlacionara esa calificación con el índice de olvido, se llegaría al gráfico FI-G. Este gráfico se usa para calcular un índice de olvido estimado que, a su vez, se usa para normalizar las calificaciones (en repeticiones retrasadas o adelantadas) y estimar el nuevo valor del A-Factor del elemento. La calificación se calcula usando la fórmula: Grade=exp A*FI+B , donde A y B son parámetros de una regresión exponencial ejecutada sobre los datos brutos recopilados durante las repeticiones.

El gráfico FI-G se actualiza después de cada repetición usando el índice de olvido esperado y las calificaciones reales obtenidas. El índice de olvido esperado puede derivarse fácilmente del intervalo usado entre repeticiones y del intervalo óptimo calculado a partir de la matriz OF. Cuanto mayor el valor del índice de olvido esperado, menor la calificación. A partir de la calificación y el gráfico FI-G, podemos calcular el índice de olvido estimado, que corresponde a la estimación posterior a la repetición de la probabilidad de olvido del elemento recién repetido en la hipotética etapa previa a la repetición. Debido a la naturaleza estocástica del olvido y el recuerdo, el mismo elemento podría recordarse o no dependiendo del estado cognitivo general actual del cerebro; ¡incluso si la fuerza y recuperabilidad de las memorias de todas las sinapsis participantes fuera/hubiera sido idéntica! De esta manera podemos hablar de la probabilidad de recuerdo previa a la repetición de un elemento que acaba de ser recordado (o no). Esta probabilidad se expresa mediante el índice de olvido estimado.

Algoritmo SM-15

El Algoritmo SM-8 se fue mejorando con los años y evolucionó hacia el Algoritmo SM-11 (2002) y luego el Algoritmo SM-15 (2011). Aquí solo presento la última versión: el Algoritmo SM-15 (usado en SuperMemo 15, SuperMemo 16, y como respaldo en SuperMemo 17).

Las mejoras clave añadidas al Algoritmo SM-8 a lo largo de dos décadas fueron:

  • indexación de estabilidad mejorada: en lugar de usar números de repetición, a partir de SuperMemo 8 (1997) el algoritmo empleó el concepto de «categoría de repetición», que se traduce aproximadamente como estabilidad
  • tolerancia para repeticiones adelantadas y retrasadas, a partir de SuperMemo 11 (2002): se añadió una heurística para tener en cuenta el efecto de espaciado
  • extensión de la representación del tiempo en los U-Factors de 60 días a 15 años (2011)
  • corrección de los datos de la curva del olvido para retrasos de repetición más allá del rango original del U-Factor (2011)

Advertencia de archivo: ¿Por qué usar archivos literales?

El Algoritmo SM-15 inicia el esfuerzo de calcular los intervalos óptimos entre repeticiones almacenando el registro de recuerdo de los elementos individuales (es decir, las calificaciones obtenidas durante el aprendizaje). Este registro se usa para estimar la fuerza actual de un rastro de memoria dado, y la dificultad del conocimiento subyacente (elemento). La dificultad del elemento expresa la complejidad de los recuerdos y refleja el esfuerzo necesario para producir rastros de memoria estables y sin ambigüedades. SuperMemo toma la tasa de recuerdo solicitada como criterio de optimización (por ejemplo, 95%), y calcula los intervalos que satisfacen este criterio. La función de los intervalos óptimos se representa en forma de matriz (matriz OF) y está sujeta a modificación según los resultados del proceso de aprendizaje. Aunque satisfacer el criterio de optimización es relativamente sencillo, la complejidad del algoritmo se deriva de la necesidad de obtener la máxima velocidad de convergencia posible a la luz de los modelos de memoria conocidos.

¡Importante! El Algoritmo SM-15 se usa únicamente para calcular los intervalos entre repeticiones de elementos. Los temas se repasan en intervalos calculados con un algoritmo completamente distinto (no descrito aquí). El calendario de repaso de temas está optimizado para gestionar la secuencia de lectura y no tiene como objetivo ayudar a la memoria. Los recuerdos a largo plazo se forman en SuperMemo principalmente con ayuda de los elementos, que se repasan siguiendo el calendario calculado por el Algoritmo SM-15.

Esta es una descripción más detallada del Algoritmo SM-15:

  1. Intervalo óptimo: los intervalos entre repeticiones se calculan con la siguiente fórmula:I(1)=OF[1,L+1]I(n)=I(n-1)*OF[n,AF]donde:
    • OF – matriz de factores óptimos, que se modifica en el curso de las repeticiones
    • OF[1,L+1] – valor de la entrada de la matriz OF tomado de la primera fila y la columna L+1
    • OF[n,AF] – valor de la entrada de la matriz OF que corresponde a la n-ésima repetición y a la dificultad AF del elemento
    • L – número de veces que un elemento dado ha sido olvidado (de » memory Lapses«, es decir, olvidos de memoria)
    • AF – número que refleja la dificultad absoluta de un elemento dado (de » Absolute difficulty Factor«, es decir, Factor de dificultad Absoluta)
    • I(n) – n-ésimo intervalo entre repeticiones para un elemento dado
  2. Repeticiones adelantadas: debido a la posibilidad de adelantar la ejecución de repeticiones (por ejemplo, un repaso forzado antes de un examen), el factor óptimo real (OF) usado para calcular el intervalo óptimo se reduce en dOF mediante fórmulas que tienen en cuenta el efecto de espaciado en el aprendizaje:dOF=dOF maxa/(t halfa)dOF max=(OF-1)*(OI+t half-1)/(OI-1)donde:
    • dOF – reducción de OF resultante del efecto de espaciado
    • a – adelanto de la repetición en días respecto al calendario óptimo (nótese que no hay cambio en OF si a=0, es decir, la repetición se realiza en el momento óptimo)
    • dOF max – límite asintótico de dOF para a infinito (nótese que para a=OI-1 la reducción sería OF-1, lo que corresponde a ningún aumento en el intervalo entre repeticiones)
    • half – el adelanto en el que se obtiene la mitad del aumento esperado de estabilidad sináptica como resultado de una repetición (actualmente este valor corresponde aproximadamente al 60% de la duración del intervalo óptimo para material bien estructurado)
    • OF – factor óptimo (es decir, OF[n,AF] para el n-ésimo intervalo y un valor dado de AF)
    • OI – intervalo óptimo (derivado de la matriz OF)
  3. Repeticiones retrasadas: debido a los posibles retrasos en la ejecución de repeticiones, la matriz OF no se indexa realmente con repeticiones sino con categorías de repetición. Por ejemplo, si la 5.ª repetición se retrasa, la matriz OF se usa para calcular la categoría de repetición, es decir, el valor teórico del número de repetición que corresponde al intervalo usado antes de la repetición. La categoría de repetición puede, por ejemplo, tomar el valor 5.3, y llegaremos a I(5)=I(4)*OF[5.3,AF], donde OF[5.3,AF] tiene un valor intermedio derivado de OF[5,AF] y OF[6,AF]
  4. Matriz de intervalos óptimos: SuperMemo ya no almacena la matriz de intervalos óptimos como en algunas versiones anteriores. En su lugar, mantiene una matriz de factores óptimos que puede convertirse en la matriz de intervalos óptimos (según la fórmula del Punto 1). La matriz de factores óptimos OF usada en el Punto 1 se ha derivado del modelo matemático del olvido y de matrices similares construidas con datos recopilados a lo largo de años de repeticiones en colecciones creadas por numerosos usuarios. Su configuración inicial corresponde a los valores hallados para un estudiante por debajo de la media. Durante las repeticiones, al recopilar cada vez más datos sobre la memoria del estudiante, la matriz se modifica gradualmente para aproximarse cada vez más a las propiedades reales de la memoria del estudiante. Tras años de repeticiones, los nuevos datos pueden retroalimentarse para generar una matriz OF inicial más precisa. En SuperMemo 17, esta matriz puede visualizarse en 3D con Tools : Statistics : Analysis : 3-D Graphs : O-Factor Matrix
  5. Dificultad del elemento: el factor de dificultad absoluta del elemento ( A-Factor), denotado AF en el Punto 1, expresa la dificultad de un elemento (cuanto más alto, más fácil el elemento). Vale la pena señalar que AF=OF[2,AF]. En otras palabras, AF denota el factor de aumento del intervalo óptimo tras la segunda repetición. Esto también equivale al mayor factor de aumento de intervalo para un elemento dado. A diferencia de los E-Factors del Algoritmo SM-6 empleado en SuperMemo 6 y SuperMemo 7, los A-Factors expresan la dificultad absoluta del elemento y no dependen de la dificultad de otros elementos en la misma colección de material de estudio
  6. Derivación de la matriz OF a partir de la matriz RF: los valores óptimos de las entradas de la matriz OF se derivan mediante una secuencia de procedimientos de aproximación a partir de la matriz RF, que se define de la misma manera que la matriz OF (véase el Punto 1), con la excepción de que sus valores se toman del proceso de aprendizaje real del estudiante para el que se ejecuta la optimización. Al principio, las matrices OF y RF son idénticas; sin embargo, las entradas de la matriz RF se modifican con cada repetición, y se calcula un nuevo valor de la matriz OF a partir de la matriz RF mediante procedimientos de aproximación. Esto produce efectivamente la matriz OF como una forma suavizada de la matriz RF. En términos simples, la matriz RF en cualquier momento dado corresponde a su valor de mejor ajuste derivado del proceso de aprendizaje; sin embargo, cada entrada se considera de mejor ajuste por sí misma, es decir, en abstracción de los valores de las demás entradas de RF. Al mismo tiempo, la matriz OF se considera de mejor ajuste en su conjunto. En otras palabras, la matriz RF se calcula entrada por entrada durante las repeticiones, mientras que la matriz OF es una copia suavizada de la matriz RF
  7. Curvas del olvido: las entradas individuales de la matriz RF se calculan a partir de las curvas del olvido aproximadas para cada entrada de forma individual. Cada curva del olvido corresponde a un valor distinto del número de repetición y a un valor distinto de A-Factor (u olvidos de memoria en el caso de la primera repetición). El valor de la entrada de la matriz RF corresponde al momento en el tiempo en que la curva del olvido cruza el punto de retención del conocimiento derivado del índice de olvido solicitado. Por ejemplo, para la primera repetición de un elemento nuevo, si el índice de olvido es del 10%, y tras cuatro días la retención del conocimiento indicada por la curva del olvido cae por debajo del 90%, el valor de RF[1,1] se toma como cuatro. Esto significa que todos los elementos que entran en el proceso de aprendizaje se repetirán después de cuatro días (suponiendo que las matrices OF y RF no difieran en la primera fila de la primera columna). Esto satisface la premisa principal de SuperMemo: que la repetición debe tener lugar en el momento en que la probabilidad de olvido sea igual al 100% menos el índice de olvido expresado en porcentaje. En SuperMemo 17, las curvas del olvido pueden verse con Tools : Statistics : Analysis : Forgetting Curves (o en 3D con Tools : Statistics : Analysis : 3-D Curves):FiguraTools : Statistics : Analysis : Forgetting Curves para 20 categorías de número de repetición multiplicadas por 20 categorías de A-Factor. En la imagen, los círculos azules representan datos recopilados durante las repeticiones. Cuanto mayor es el círculo, mayor es el número de repeticiones registradas. La curva roja corresponde a la curva del olvido de mejor ajuste obtenida mediante regresión exponencial. Para material mal estructurado, la curva del olvido es irregular, es decir, no exactamente exponencial. La línea aguamarina horizontal corresponde al índice de olvido solicitado, mientras que la línea verde vertical muestra el momento en el tiempo en que la curva del olvido aproximada intersecta con la línea del índice de olvido solicitado. Este momento en el tiempo determina el valor del R-Factor correspondiente, e indirectamente, el valor del intervalo óptimo. Para la primera repetición, el R-Factor corresponde al primer intervalo óptimo. Los valores de O-Factor y R-Factor se muestran en la parte superior del gráfico. A continuación aparece el número de casos de repetición usados para trazar el gráfico (es decir, 21.303). Al inicio del proceso de aprendizaje no hay historial de repeticiones ni datos de repetición para calcular los R-Factors. Pasará algún tiempo antes de que se tracen tus primeras curvas del olvido. Por esa razón, el valor inicial de la matriz RF se toma del modelo de un estudiante por debajo de la media. El modelo de estudiante promedio no se usa porque la convergencia desde parámetros de un estudiante peor hacia arriba es más rápida que la convergencia en la dirección opuesta. El parámetro de Desviación mostrado en la parte superior indica qué tan bien la curva negativamente exponencial se ajusta a los datos. Cuanto menor es la desviación, mejor es el ajuste. La desviación se calcula como la raíz cuadrada del promedio de las diferencias al cuadrado (como se usa en el método de mínimos cuadrados).Figura: representación 3D de la familia de curvas del olvido para una única dificultad de elemento y niveles variables de estabilidad de memoria (normalizados para el U-Factor).Figura: curva del olvido acumulativa para material de aprendizaje de complejidad mixta, y estabilidad mixta. El gráfico se obtiene por superposición de 400 curvas del olvido normalizadas para la constante de decaimiento de 0,003567, que corresponde a un recuerdo del 70% en el 100% del periodo de tiempo presentado (es decir, R=70% en el borde derecho del gráfico). Se han incluido 401.828 casos de repetición en el gráfico. Las curvas individuales están representadas por puntos de datos amarillos. La curva acumulativa está representada por puntos de datos azules que muestran el recuerdo promedio de las 400 curvas. El tamaño de los círculos corresponde al tamaño de las muestras de datos.
  8. Derivación de la matriz OF a partir de las curvas del olvido: la matriz OF se deriva de la matriz RF mediante:
    1. aproximación de potencia de punto fijo del descenso del R-Factor a lo largo de las columnas de la matriz RF (el punto fijo corresponde a la segunda repetición en la que la curva de aproximación pasa por el valor de A-Factor),
    2. para todas las columnas, el cálculo del D-Factor, que expresa la constante de decaimiento de la aproximación de potencia,
    3. regresión lineal del cambio de D-Factor a través de las columnas de la matriz RF, y
    4. derivación de toda la matriz OF a partir de la pendiente y la intersección de la recta que constituye el mejor ajuste en el gráfico de D-Factor. Las fórmulas exactas usadas en este último paso van más allá del alcance de esta ilustración.
    Nótese que la primera fila de la matriz OF se calcula de una manera distinta. Corresponde a la curva exponencial de mejor ajuste obtenida de la primera fila de la matriz RF. Todos los pasos anteriores se ejecutan tras cada repetición. En otras palabras, el valor teóricamente óptimo de la matriz OF se actualiza tan pronto como se recopilan nuevos datos de la curva del olvido, es decir, en el momento, durante la repetición, en que el estudiante, al dar una calificación, indica el recuerdo correcto o incorrecto (es decir, el olvido) (en el Algoritmo SM-6 había que usar un procedimiento separado, Approximate, para hallar la matriz OF de mejor ajuste, y la matriz OF usada en las repeticiones podía diferir sustancialmente de su valor de mejor ajuste)
  9. Dificultad del elemento: el valor inicial de A-Factor se deriva de la primera calificación obtenida por el elemento y del gráfico de correlación entre la primera calificación y el A-Factor ( gráfico G-AF). Este gráfico se actualiza tras cada repetición en la que se estima un nuevo valor de A-Factor y se correlaciona con la primera calificación del elemento. Las aproximaciones posteriores del valor real de A-Factor se realizan tras cada repetición usando las calificaciones, la matriz OF y un gráfico de correlación que muestra la correspondencia entre la calificación y el índice de olvido esperado ( gráfico FI-G). La calificación usada para calcular el A-Factor inicial se normaliza, es decir, se ajusta según la diferencia entre el intervalo realmente usado y el intervalo óptimo para un índice de olvido igual al 10%
  10. Correlación entre las calificaciones y el índice de olvido esperado: el gráfico FI-G se actualiza tras cada repetición usando el índice de olvido esperado y las calificaciones reales obtenidas. Cuanto mayor sea el valor del índice de olvido esperado, menor será la calificación. El índice de olvido esperado puede derivarse fácilmente del intervalo usado entre repeticiones y el intervalo óptimo calculado a partir de la matriz OF. A partir de la calificación y del gráfico FI-G (véase: gráfico FI-G en Tools : Statistics : Analysis : Graphs), podemos calcular el índice de olvido estimado, que corresponde a la estimación posterior a la repetición de la probabilidad de olvido del elemento recién repetido en la hipotética etapa previa a la repetición. Debido a la naturaleza estocástica del olvido y el recuerdo, un mismo elemento podría o no ser recordado dependiendo del estado cognitivo general del cerebro en ese momento; ¡incluso si la fuerza y la recuperabilidad de las memorias de todas las sinapsis implicadas son/eran idénticas! De esta manera podemos hablar de la probabilidad de recuerdo previa a la repetición de un elemento que acaba de ser recordado (o no). Esta probabilidad se expresa mediante el índice de olvido estimado
  11. Cálculo de los A-Factors: a partir de (1) el índice de olvido estimado, (2) la duración del intervalo y (3) la matriz OF, podemos calcular fácilmente el valor más preciso del A-Factor. Nótese que el A-Factor sirve como índice de la matriz OF, mientras que el índice de olvido estimado permite hallar la columna de la matriz OF para la que el intervalo óptimo corresponde al intervalo realmente usado, corregido por la desviación del índice de olvido estimado respecto al índice de olvido solicitado. En cada repetición se toma un promedio ponderado del antiguo A-Factor y el nuevo valor estimado del A-Factor. El A-Factor recién obtenido se usa para indexar la matriz OF al calcular el nuevo intervalo óptimo entre repeticiones

En resumen. Las repeticiones resultan en el cálculo de un conjunto de parámetros que caracterizan la memoria del estudiante: la matriz RF, el gráfico G-AF, y el gráfico FI-G. También se usan para calcular los A-Factors de elementos individuales que caracterizan la dificultad del material aprendido. La matriz RF se suaviza para producir la matriz OF, que a su vez se usa para calcular el intervalo óptimo entre repeticiones para elementos de distinta dificultad ( A-Factor) y distinto número de repeticiones (u olvidos de memoria en el caso de la primera repetición). Inicialmente, todos los parámetros de memoria del estudiante se toman como los de un estudiante por debajo de la media (esto produce una convergencia más rápida que un estudiante promedio o por encima de la media), mientras que todos los A-Factors se suponen iguales (desconocidos).

1997: el empleo de redes neuronales

Redes neuronales: un interés incipiente

A mediados de la década de 1980 leí » Brains, Machines and Mathematics» de Michael Arbib. Ese libro consolidó mi visión del cerebro como una máquina de cómputo eficiente.

Para cualquiera con interés en cómo funciona el cerebro —y esto es casi todo el mundo— las redes neuronales resultan naturalmente fascinantes. Mientras estudiaba informática, adquirí una nueva perspectiva computacional del cerebro y de las redes neuronales. Como las redes neuronales tienen una asombrosa capacidad para hacer su propio modelado, podría parecer natural emplearlas para estudiar los datos de memoria y así obtener respuestas sobre cómo funciona la memoria. Sin embargo, las redes neuronales tienen una gran desventaja: no comparten fácilmente sus hallazgos. Es un poco como el problema del propio cerebro: puede hacer cosas mágicas y, aun así, es difícil decir qué está pasando realmente en su interior. Es divertido escribir software de redes neuronales; yo probé eso en 1989. Es algo menos divertido ver una red neuronal en acción.

El enfoque algebraico de SuperMemo superó a las redes neuronales por dos razones: (1) mis preguntas sobre la memoria siempre parecían demasiado simples como para requerir redes neuronales, y (2) las redes necesitan datos, que necesitan aprendizaje, que necesita un algoritmo, que necesita responder preguntas simples. En esta carrera del huevo y la gallina, mi cerebro siempre iba un paso por delante de lo que podría deducir de los datos disponibles con una red neuronal.

La superioridad del enfoque algebraico es evidente si consideramos que el intervalo óptimo puede hallarse simplemente trazando una curva del olvido y empleando regresión para encontrar el punto en el que el recuerdo cae por debajo del 90%. Esto fue incluso más extremo en mi experimento de 1985, donde mi «curva del olvido» estaba formada por solo 5 puntos. Podía elegir la que más me gustaba. Aquello era un ejercicio de preescolar. No hacían falta grandes recursos.

En 1990, mientras trabajaba en el modelo de aprendizaje intermitente, estuve más cerca que nunca de emplear redes neuronales. Tras una discusión de 7 horas con Murakowski el 6 de julio de 1990, concluimos que una red neuronal podría aportar algunas respuestas. Sin embargo, mi ordenador ya estaba procesando datos usando métodos algebraicos de ascenso de colina (hill-climbing). En esencia, esto es similar a la extracción de características en las redes neuronales. Una vez que obtuve mis respuestas, esa motivación desapareció.

Sin embargo, a mediados de la década de 1990 recibíamos cada vez más preguntas sobre la adaptabilidad del algoritmo y la posibilidad de emplear redes neuronales. Esas preguntas las planteaban principalmente quienes no entienden bien SuperMemo. El modelo detrás de SuperMemo es simple, las herramientas de optimización son simples, y funcionan bastante bien para nuestra satisfacción. El primerísimo enfoque computacional, el Algoritmo SM-2, sigue usándose hasta hoy. La insatisfacción humana con la memoria suele provenir de expectativas irrazonables construidas por los planes de estudio escolares, y de nuestra escasa capacidad para formular el conocimiento de forma que sea fácil de asimilar. Este último hábito también se perpetúa por la costumbre de memorizar a última hora que traemos de la escuela. Los algoritmos de SuperMemo no pueden remediar esa insatisfacción con el aprendizaje. Siempre han funcionado bien, y los últimos 30 años han aportado un progreso que puede medirse matemáticamente, pero que no se traduce fácilmente en un aumento del placer de aprender.

El empuje hacia las redes neuronales

En la década de 1990, el correo que llegaba a SuperMemo World a menudo incluía insinuaciones de que el enfoque de redes neuronales sería superior. Incluso tras una década de uso de SuperMemo, un estudiante podía escribir:

SuperMemo no tiene en cuenta las distintas capacidades y necesidades de los usuarios. En cambio, asume que todo aprendiz es un «mal aprendiz». Como tal, cada aprendiz tendrá el mismo intervalo de repetición, ya que su algoritmo subyacente está fijado de antemano, lo cual puede no ser muy eficiente si eres un aprendiz mejor o distinto. […] Las redes neuronales tienen en cuenta que existen tipos muy diferentes de aprendices que necesitan intervalos de repetición óptimos distintos. Al repasar palabras nuevas y «decirle» al programa lo bien o mal que lo hizo, el aprendiz revela cada vez más qué tipo de aprendiz es realmente. Tras esta retroalimentación, los programas son capaces de adaptar y optimizar sus intervalos de repetición subyacentes si es necesario

Esas palabras indican una falta de comprensión de SuperMemo. SuperMemo no usa un «modelo de mal estudiante». Simplemente parte de intervalos más cortos antes de recopilar los primeros datos sobre la memoria del estudiante. La elección de intervalos más cortos proviene de una aproximación más rápida al modelo óptimo. En otras palabras, SuperMemo se adapta a cada estudiante individual, y el «modelo de estudiante por debajo de la media» podría atribuirse al punto de partida antes de que se recopile ningún dato.

En SuperMemo, el modelo de estudiante promedio se usa únicamente como condición inicial en el proceso de hallar el modelo de la memoria real del estudiante.

En una optimización de trayectoria de dimensión finita, la convergencia es más rápida cuando se parte de una buena estimación del estado inicial. Aunque esto no sucede en SuperMemo debido a la naturaleza simple, tridimensional, de la función de intervalos óptimos, en el caso general, la búsqueda de soluciones puede fallar y la optimización no funcionar. A diferencia de las matrices univalentes usadas en versiones antiguas de SuperMemo con fines de investigación, un algoritmo de red neuronal produciría caos sin un preentrenamiento previo. Por eso se usan datos de aprendizaje previos para actualizar el modelo de estudiante promedio o por debajo de la media usado en SuperMemo, con el fin de lograr la máxima velocidad de convergencia.

Nótese que este enfoque de estudiante promedio es aún menos relevante en el Algoritmo SM-17 debido al uso de aproximaciones de mejor ajuste para múltiples parámetros y funciones en el proceso de aprendizaje (por ejemplo, la dificultad del elemento, la función de aumento de estabilidad, etc.). Esto significa que SuperMemo siempre sacará el mejor partido de los datos disponibles (usando nuestro mejor conocimiento actual de los modelos de memoria).

La forma aproximada de la curva del olvido se conoce desde hace más de un siglo (véase: Error de la curva del olvido de Ebbinghaus). SuperMemo recopila datos precisos sobre la forma de las curvas del olvido para elementos de distinta dificultad y distinta estabilidad de memoria. A partir de las curvas del olvido, SuperMemo deriva fácilmente el intervalo óptimo. Los datos provienen de un único estudiante, y cada repetición contribuye a la precisión del cálculo. En otras palabras, con cada minuto que pasas con SuperMemo, el programa te conoce cada vez mejor. Además, te conoce bastante bien tras un mes o dos. Nunca necesitas preocuparte por la eficiencia del algoritmo.

Existe un aura de misterio en torno a las redes neuronales. Se supone que revelan propiedades ocultas de los fenómenos estudiados. Es fácil olvidar que las redes pueden fallar con facilidad cuando se les alimenta con información incorrecta o cuando falta información vital. Este fue el caso de la única red neuronal funcional usada en repetición espaciada: MemAid, de David Calinski.

El error en el diseño de la red MemAid provino de usar Intervalo + Número de repeticiones como entrada para representar el estado de la memoria, cuando estas dos variables no corresponden con el par Estabilidad : Recuperabilidad. Se ha demostrado que Estabilidad y Recuperabilidad son necesarias para representar el estado de un rastro de memoria a largo plazo. En otras palabras, la red no recibe toda la información que necesita para calcular el intervalo óptimo. Un mejor diseño codificaría todo el historial de repeticiones, por ejemplo, mediante el uso de las variables de estabilidad y recuperabilidad. Se necesita el historial de repeticiones completo para tener en cuenta el efecto de espaciado de una presentación masiva o un aumento significativo de la estabilidad por calificaciones aprobatorias en repeticiones retrasadas. El diseño de Calinski, sin embargo, cumpliría los requisitos básicos para aprender en intervalos «óptimos» con pocas desviaciones de las reglas de la repetición espaciada (tanto como el Algoritmo SM-2).

¿Es inflexible SuperMemo?

No es cierto que SuperMemo sea prejuicioso mientras que una red neuronal no lo sea. Nada impide que las matrices de optimización de SuperMemo se aparten del modelo de memoria y produzcan un resultado inesperado. Es cierto que, con los años, y con cada vez más conocimiento sobre cómo funciona la memoria, el algoritmo usado en SuperMemo se ha ido armando con restricciones y subalgoritmos personalizados. Sin embargo, ninguno de ellos fue resultado de una conjetura al azar. La progresión del «prejuicio» en los algoritmos de SuperMemo no es más que un reflejo de los hallazgos de años anteriores. Lo mismo afectaría inevitablemente a cualquier implementación de red neuronal que quisiera maximizar su rendimiento.

Tampoco es cierto que los valores preestablecidos originales de las matrices de optimización en SuperMemo sean una forma de prejuicio. Estos son el equivalente al preentrenamiento en una red neuronal. Una red neuronal que no ha sido preentrenada también tardará más en converger hacia el modelo óptimo. Por eso SuperMemo está «preentrenado» con el modelo de un estudiante promedio.

La tasa de aumento del intervalo está determinada por la matriz de intervalos óptimos y en absoluto es constante. Además, la matriz de intervalos óptimos cambia con el tiempo dependiendo del rendimiento del usuario. Puede que tengas la impresión de un algoritmo fijo o rígido solo tras meses o años de uso (la velocidad de cambio es inversamente proporcional a los datos de aprendizaje disponibles). Esta convergencia refleja la invariabilidad del sistema de memoria humano. No importa si usas el enfoque algebraico o neuronal para el problema de optimización. Al final, llegarás a la función de repetición espaciada que refleja las propiedades reales de tu memoria. En ese sentido, la velocidad de convergencia debería considerarse un indicador de la calidad del algoritmo. En otras palabras, cuanto más rápido se «fije» la función de intervalo, mejor.

Finalmente, hay otra área en la que las redes neuronales deben usar el conocimiento existente de los modelos de memoria (es decir, cargar con una dosis de prejuicio) o perder eficiencia. La red neuronal experimental SuperMemo, MemAid, así como FullRecall, han mostrado todas una debilidad inherente. La red alcanza la estabilidad cuando los intervalos producen el efecto deseado (por ejemplo, un nivel específico del índice de olvido medido). Cada vez que la red se aparta del modelo óptimo, se le alimenta con una estimación heurística del valor del intervalo óptimo según la calificación obtenida durante las repeticiones (por ejemplo, calificación=5 correspondería al 130% del intervalo óptimo en SuperMemo NN o al 120% en MemAid). El SuperMemo algebraico, en cambio, puede calcular una estimación de la dificultad, usar la medición precisa de la retención y producir un ajuste preciso del valor de la matriz de aumento de estabilidad. En otras palabras, no adivina el intervalo óptimo. Calcula su valor exacto para esa repetición en particular. Los ajustes a las matrices de memoria están ponderados y producen una convergencia estable sin oscilaciones. En otras palabras, es el modelo de memoria lo que permite eliminar el factor de conjetura. En ese sentido, el SuperMemo algebraico está menos sesgado por prejuicios que el SuperMemo neuronal.

La futilidad de afinar el algoritmo de repetición espaciada

El Algoritmo SM-17 es un gran paso adelante; sin embargo, muchos usuarios no notarán la mejora y se quedarán con los algoritmos antiguos. Este problema de percepción dio lugar al «mito de SM3+», que intenté disipar en este artículo. Al mismo tiempo, el valor del nuevo algoritmo para el progreso futuro de la investigación es astronómico. En otras palabras, existe una gran disonancia entre las necesidades prácticas y las necesidades teóricas. Mis palabras en una entrevista para Enter, 1994, siguen siendo ciertas:

Ya hemos visto que la evolución habla a favor de SuperMemo, que los hallazgos en el campo de la psicología coinciden con el método, y que los hechos de la biología molecular y las conclusiones que surgen del modelo de Wozniak parecen ir de la mano. Este es el momento de ver cómo se han puesto en práctica los mecanismos descritos en el propio programa. En el curso de las repeticiones, SuperMemo traza la curva del olvido para el estudiante y programa la repetición en el momento en que la retención, es decir, la proporción de conocimiento recordado, cae a un nivel previamente definido. En otras palabras, SuperMemo comprueba cuánto recuerdas tras una semana y, si recuerdas menos de lo deseado, te pide que hagas repeticiones en intervalos de menos de una semana. De lo contrario, comprueba la retención tras un periodo más largo y aumenta los intervalos en consecuencia. Un pequeño matiz a este cuadro sencillo proviene del hecho de que los elementos de distinta dificultad deben repetirse en intervalos distintos, y que los intervalos aumentan a medida que avanza el proceso de aprendizaje. Además, los intervalos óptimos entre repeticiones deben conocerse para un individuo promedio, y estos deben usarse antes de que el programa pueda recopilar datos sobre el estudiante real. Obviamente, debe existir todo un aparato matemático involucrado para poner en marcha toda la maquinaria. En definitiva, Wozniak dice que ha habido al menos 30 días en su vida en los que tuvo la impresión de que los algoritmos usados en SuperMemo se habían mejorado significativamente. Cada uno de esos casos parecía un gran avance. Todo el proceso de desarrollo fue simplemente una larga sucesión de ensayos y errores, pruebas, mejoras, implementación de nuevas ideas, etc. Por desgracia, esos buenos días han quedado atrás. No ha habido ninguna mejora decisiva del algoritmo desde 1991. Puede consolarnos el hecho de que, desde entonces, el software empezó a desarrollarse rápidamente, ofreciendo al usuario nuevas opciones y soluciones. ¿Puede entonces SuperMemo ser aún mejor, más rápido, más eficaz? Wozniak es pesimista. Cualquier ajuste adicional de los algoritmos, aplicando inteligencia artificial o redes neuronales, se ahogaría en el ruido de las interferencias. Después de todo, no aprendemos aislados del mundo. Cuando el programa programa la siguiente repetición para dentro de 365 días, y el hecho se recuerda por casualidad antes de esa fecha, SuperMemo no tiene forma de saber sobre ese recuerdo accidental y ejecutará la repetición en el momento previamente planificado. Esto no es óptimo, pero no puede remediarse mejorando el algoritmo. Mejorar SuperMemo ahora es como afinar un receptor de radio en una ruidosa nave de montaje de coches. La gente de SuperMemo World está ahora menos centrada en la ciencia. En su opinión, tras la invención científica, ha llegado el momento de la invención social de SuperMemo.

El proyecto de red neuronal de Dreger

El 20 de mayo de 1997, mi amigo de la era pre-web de las BBS, Bartek Dreger, tuvo una gran idea. Él también escribiría su Tesis de Maestría sobre SuperMemo en el Instituto de Ciencias de la Computación de la Universidad Politécnica de Poznan. Eso sería 8 años después de la mía propia, salvo que él usaría redes neuronales para ver cómo funcionaban. A pesar de ser casi dos décadas más joven, su plan era intentar este proyecto en el mismo estupendo equipo de investigación operativa de Węglarz que menciono a menudo en otras partes de este texto. Ya en 1990, el Dr. Nawrocki tuvo la idea de usar redes neuronales para mejorar SuperMemo. La gran mente del Prof. Roman Słowiński sería el supervisor. Esto realmente podía funcionar.

Para junio de 1997, otro de mis amigos de la red, Piotr Wierzejewski, se unió al proyecto. Luego se subieron a bordo 3 estudiantes más de informática. Era un encantador equipo de cinco jóvenes cerebros con una edad combinada de 100 años. Pronto el proyecto se amplió con la idea de un SuperMemo en línea apodado: WebSorb (por la absorción de conocimiento desde la web). Como suele ocurrir en equipos jóvenes y entusiastas, empezamos a abarcar demasiado, y al final solo se alcanzó una fracción de los objetivos. Solo la idea del SuperMemo en línea siguió evolucionando y ramificándose de forma sinuosa, con varios miniproyectos que nacían y morían (por ejemplo, e-SuperMemo, Quizer, Super-Memorizer, Memorathoner, etc.) hasta la aparición de 3GEMs, que se convirtió en supermemo.net, que finalmente evolucionó hasta el actual supermemo.com.

La mayor ventaja de la juventud en proyectos similares es la creatividad y la pasión. El mayor obstáculo es la escuela y, más tarde, otras obligaciones, incluida la de tener hijos. Este fantástico grupo de mentes cayó víctima del viejo problema de la escuela: convertir un proyecto nacido de la pasión en un proyecto que se convierte en una tarea escolar con plazos, informes, exámenes y calificaciones. Como se explica aquí, SuperMemo también nació en ese arriesgado entorno escolar. La clave del éxito es la lucha por la libertad. La sujeción destruye las pasiones. La idea de SuperMemo sobrevivió a la presión de la escolarización gracias a mi empeño por la libertad educativa.

SuperMemo de red neuronal : por qué el modelo de memoria es vital en los algoritmos de SuperMemo

La extracción de características propuesta para las redes neuronales de repetición espaciada se basa en la existencia bien demostrada de dos componentes de la memoria a largo plazo descritos aquí.

Las dos variables de memoria son suficientes para representar el estado de un rastro de memoria atómico en el aprendizaje. Estas variables permiten calcular los intervalos óptimos y tener en cuenta el efecto de espaciado. También se conoce la función de aumento de la estabilidad de memoria para repeticiones retrasadas. Por esas razones, un algoritmo de optimización simple facilita y agiliza la determinación del espaciado óptimo de repeticiones en SuperMemo. Una red neuronal necesitaría codificar el historial completo de repeticiones de cada elemento, y las opciones de codificación más obvias son la estabilidad (S) y la recuperabilidad (R) de la memoria. En otras palabras, los mismos supuestos subyacen al diseño de los algoritmos de espaciado de repeticiones: algebraicos o neuronales. Huelga decir que la solución algebraica es fácil y rápida. Converge rápido. No requiere preentrenamiento (el modelo de memoria está encapsulado en la matriz de intervalos óptimos).

Una red neuronal que trabaje con historiales de repetición completos producirá el mismo resultado que un algoritmo de ascenso de colina empleado en la construcción de la estabilidad de la memoria. El ascenso de colina es simplemente una herramienta mejor y más rápida para la tarea. Tendrá las mismas limitaciones que las redes neuronales, es decir, las respuestas serán tan buenas como la pregunta planteada.

SuperMemo de red neuronal: diseño

Junto con Bartek Dreger diseñamos un sistema ANN simple para abordar el problema de la repetición espaciada (dic. 1997). Nótese que este proyecto no habría sido posible sin la experiencia del Dr. Krzysztof Krawiec, quien ayudó a pulir el diseño:

Advertencia de archivo: ¿Por qué usar archivos literales?

El problema del espaciado de repeticiones consiste en calcular los intervalos óptimos entre repeticiones en el proceso de aprendizaje humano. Los intervalos se calculan para piezas individuales de información (llamadas más adelante elementos) y para un individuo dado. Todos los datos de entrada son las calificaciones obtenidas por el estudiante en las repeticiones de los elementos durante el proceso de aprendizaje. Hasta ahora, este problema se ha resuelto de forma más eficaz mediante una serie sucesiva de algoritmos conocidos comercialmente como SuperMemo y desarrollados por el Dr. Wozniak en SuperMemo World, Polonia. El modelo de memoria de Wozniak, usado en el desarrollo de la versión más reciente del algoritmo (el Algoritmo SM-8), no puede considerarse como la descripción algebraica definitiva de la memoria humana a largo plazo. En particular, la relación entre la complejidad del patrón sináptico y la dificultad del elemento no se comprende bien. Podría arrojarse más luz sobre esta relación una vez que se emplee una red neuronal para proporcionar una correspondencia adecuada entre el estado de la memoria, la calificación y la dificultad del elemento.

Usando las soluciones actuales de vanguardia, la viabilidad técnica de una aplicación de red neuronal en un proceso de aprendizaje en tiempo real parece depender de la aplicación adecuada de la comprensión del proceso de aprendizaje para definir de manera adecuada los problemas que se plantearán a la red neuronal. Sería imposible esperar que la red genere la solución al recibir como entrada el historial de calificaciones dadas en el curso de las repeticiones de miles de elementos. La complejidad computacional y espacial de tal enfoque naturalmente superaría con creces la capacidad de la red para aprender y responder en tiempo real.

Usando el modelo de Wozniak de los dos componentes de la memoria a largo plazo, postulamos que la siguiente solución de red neuronal podría dar lugar a una convergencia rápida y una alta precisión en el espaciado de repeticiones.

Las dos variables de memoria necesarias para describir el estado de un engrama dado son la recuperabilidad (R) y la estabilidad (S) de la memoria ( Wozniak, Gorzelańczyk, Murakowski, 1995). La siguiente ecuación relaciona R y S:

(1) R=e -k/S*t

donde:

  • k es una constante
  • t es el tiempo

Usando la Ec. (1) concluimos sobre los cambios de la recuperabilidad en el tiempo para una estabilidad dada, y también podemos determinar el intervalo óptimo entre repeticiones para una estabilidad y un índice de olvido dados.

La forma algebraica exacta de la función que describe el cambio de la estabilidad tras una repetición no se conoce. Sin embargo, los datos experimentales indican que la estabilidad suele aumentar de 1,3 a 3 veces para repeticiones bien cronometradas, y depende de la dificultad del elemento (cuanto mayor la dificultad, menor el aumento). Al proporcionar la aproximación del espaciado óptimo de repeticiones tomada de los datos experimentales generados por las matrices de optimización del Algoritmo SM-8, la red neuronal puede preentrenarse para calcular la función de estabilidad:

(2) S i+1=f s(R,Si,D,G)

donde:

  • i es la estabilidad tras la i-ésima repetición
  • R es la recuperabilidad antes de la repetición
  • D es la dificultad del elemento
  • G es la calificación dada en la i-ésima repetición

La función de estabilidad es la primera función que debe determinar la red neuronal. La segunda es la función de dificultad del elemento, con parámetros de entrada análogos:

(3) D i+1=f d(R,S,Di,G)

donde:

  • i es la aproximación de la dificultad del elemento tras la i-ésima repetición
  • R es la recuperabilidad antes de la repetición
  • S es la estabilidad tras la i-ésima repetición
  • G es la calificación dada en la i-ésima repetición

En consecuencia, una red neuronal con cuatro entradas (D, R, S y G) y dos salidas (S y D) puede usarse para encapsular todo el conocimiento necesario para calcular los intervalos entre repeticiones (véase: Implementación de la red neuronal de espaciado de repeticiones).

Se adoptará el siguiente enfoque para verificar la viabilidad del planteamiento mencionado:

  1. el preentrenamiento de la red neuronal se realizará sobre la base de las funciones S y D aproximadas, derivadas de las funciones usadas en el Algoritmo SM-8 y de los datos experimentales recopilados a partir de él
  2. Dicha red preentrenada se implementará como un SuperMemo Plug-In DLL que sustituirá al estándar sm8opt.dll usado por SuperMemo 8 para Windows. La enseñanza de la red continuará en un proceso de aprendizaje real durante las pruebas alfa del DLL de la red neuronal. Se usará un procedimiento diseñado específicamente para el experimento con el fin de proporcionar resultados acumulativos y una red neuronal resultante. El procedimiento usará las redes neuronales empleadas en las pruebas alfa para entrenar la red que participará en las pruebas beta. Las redes de las pruebas alfa se alimentarán con una matriz de parámetros de entrada, y su salida se usará como datos de entrenamiento para la red resultante
  3. En el último paso, las pruebas beta de la red neuronal estarán abiertas a todos los voluntarios en internet directamente desde el sitio web de SuperMemo. A los voluntarios solo se les pedirá que envíen sus redes resultantes para la etapa final del experimento, en la que se desarrollará la red definitiva. De nuevo, las redes de las pruebas beta se usarán todas para entrenar la red resultante. Los futuros usuarios del SuperMemo de red neuronal (si el proyecto resulta exitoso) obtendrán una red con una comprensión razonable de la memoria humana, capaz de seguir perfeccionando sus reacciones ante la interferencia del proceso de aprendizaje con las actividades cotidianas de un estudiante y un material de estudio en particular.

El problema principal en todos los algoritmos de espaciado es el retraso entre comparar la salida de la función de intervalos óptimos con el resultado de aplicar en la práctica un intervalo entre repeticiones dado. En cada repetición, debe recordarse el estado de la red de la repetición anterior para poder generar el nuevo estado de la red. En la práctica, esto equivale a almacenar un número enorme de estados de la red entre repeticiones.

Afortunadamente, el modelo de Wozniak implica que las funciones S y D son independientes del tiempo (curiosamente, también es probable que sean independientes del usuario); por lo tanto, puede adoptarse el siguiente enfoque para simplificar el procedimiento:

Momento en el tiempoT1T2T3
Decisión111=N 1(I 1)222=N 2(I 2)333=N 3(I 3)
Resultado de la decisión anteriorO* 11=O* 1-O 1O* 22=O* 2-O 2
Evaluación para el entrenamientoO’ 1=N 2(I 1)E’ 1=O* 1-O’ 1O’ 2=N 3(I 2)E’ 2=O* 2-O’ 2

Donde:

  • i es un límite de error con O i (véase corrección de error para la estabilidad de memoria y corrección de error para la dificultad del elemento)
  • E’ i es un límite de error con O’ i
  • i son los datos de entrada en T i
  • i es el estado de la red en T i
  • i es una decisión de salida de N i dado I i, es decir, la decisión tras la i-ésima repetición tomada en T i
  • O* i es la decisión de salida óptima, que debería obtenerse en T i en lugar de O i; puede calcularse a partir de la calificación y O i (la calificación indica cómo debería haber cambiado O i para obtener una mejor aproximación)
  • O’ i es una decisión de salida de N i+1 dado I i, es decir, la decisión tras la i-ésima repetición que se tomaría en T i+1
  • i es el momento de la i-ésima repetición de un elemento dado

El enfoque anterior solo requiere almacenar I i-1 para cada elemento entre repeticiones que tienen lugar en T i-1 y T i, con un ahorro sustancial en la cantidad de datos almacenados durante el proceso de aprendizaje (E’ i es tan valioso para el entrenamiento como E i). De esta manera, la solución propuesta es comparable en cuanto a su complejidad espacial con el Algoritmo SM-8. Solo hay que recordar un (el actual) estado de la red neuronal durante todo el proceso.

Estas son las suposiciones de implementación actuales para el proyecto en cuestión:

  • red neuronal: unidireccional, en capas, con retropropagación elástica (resilient back-propagation); una capa de entrada con cuatro neuronas, una capa de salida con dos neuronas, y dos capas ocultas (15 neuronas cada una)
  • interpretación de la dificultad del elemento: igual que en el Algoritmo SM-8, es decir, definida por el A-Factor
  • cada elemento almacena: fecha de la última repetición, estabilidad (en la última repetición), recuperabilidad (en la última repetición), dificultad del elemento, última calificación
  • índice de olvido predeterminado: 10%
  • entrada del DLL de la red (en cada repetición): número de elemento y calificación actual
  • salida del DLL de la red (en cada repetición): fecha de la próxima repetición
  • lenguaje de implementación del DLL de la red neuronal: C++
  • shell del DLL de la red neuronal, SuperMemo 98 para Windows (igual que el shell de 32 bits de SM8OPT.DLL)

SuperMemo de red neuronal: implementación

A la red se le ha entregado prácticamente en bandeja de plata el algoritmo de repetición espaciada. Su único papel sería afinar el rendimiento con el tiempo. Esto es exactamente lo que hacen todos los algoritmos de SuperMemo a partir del Algoritmo SM-5. En ese sentido, el diseño no le pedía a la red un descubrimiento. Le pedía mejoras sobre el descubrimiento. El modelo estaba integrado en el diseño.

Advertencia de archivo: ¿Por qué usar archivos literales?

Suposición básica

El estado de la memoria se describirá con solo dos variables: recuperabilidad (R) y estabilidad (S) ( Wozniak, Gorzelańczyk, Murakowski, 1995). La siguiente ecuación relaciona R y S:

(1) R=e -k/S*t

donde:

  • k es una constante
  • t es el tiempo

Por simplicidad, fijaremos k=1 para definir unívocamente la estabilidad.

Entrada y salida

La red deberá determinar las siguientes funciones:

(2) S i+1=f s(R, S i, D, G)

(3) D i+1=f d(R, S, D i, G)

Se supone que la red neuronal genera la estabilidad (S) y la dificultad del elemento (D) en la salida, dados R, S, D y G en la entrada:

(4) (Ri, Si, Di, Gi) => (D i+1,S i+1)

donde:

  • i es la recuperabilidad antes de la i-ésima repetición
  • i es la estabilidad antes de la i-ésima repetición
  • i+1 es la estabilidad tras la i-ésima repetición
  • i es la dificultad del elemento antes de la i-ésima repetición
  • i+1 es la dificultad del elemento tras la i-ésima repetición
  • i es la calificación dada en la i-ésima repetición

Corrección de error para la dificultad D

La dificultad objetivo se definirá, como en el Algoritmo SM-8, como la razón entre el segundo y el primer intervalo. El plug-in de red neuronal (NN.DLL) registrará este valor para todos los elementos individuales y lo usará para entrenar la red:

(5) D o=I 2/I 1

donde:

  • o es la dificultad guía usada en la corrección de error (cuanto mayor es D o, menor es la dificultad)
  • 1 es el primer intervalo óptimo calculado para el elemento en cuestión (igual para todos los elementos)
  • 2 es el segundo intervalo óptimo calculado para el elemento

¡Importante! Los intervalos óptimos I 1 e I 2 no son los propuestos por la red antes de su verificación, sino los usados en la corrección de error después de que el intervalo propuesto ya se haya ejecutado y verificado (véase corrección de error para la estabilidad S)

El valor inicial de la dificultad se fijará en 3,5, es decir, D 1=3,5. Esto es solo por similitud con el Algoritmo SM-8. Como la dificultad inicial no se conoce, no puede usarse para determinar el primer intervalo. Tras registrar la primera calificación, la corrección de error sigue siendo imposible debido a que aún no se conoce el segundo intervalo óptimo. Una vez que se conoce, D o puede usarse para la corrección de error de D en la salida.

Para evitar problemas de convergencia en la red, se usará la siguiente fórmula para determinar la salida correcta de D:

(6) D opt=0,9*D i+0,1*D o

donde:

  • opt es la dificultad usada en la corrección de error tras la i-ésima repetición
  • i es la dificultad antes de la i-ésima repetición
  • o es la dificultad guía de la Ec. (5)

El factor de convergencia de 0,9 en la Ec. (6) es arbitrario y puede cambiar según el rendimiento de la red.

Corrección de error para la estabilidad S

La siguiente fórmula, derivada de la Ec. (1) para un índice de olvido igual al 10% y k=1, facilita la conversión entre la estabilidad y el intervalo óptimo: I=-ln(0,9)*S

En el caso óptimo, la red debería generar el índice de olvido solicitado para cada repetición. El índice de olvido variable puede usarse fácilmente una vez que se conoce la estabilidad S (véase la Ec. (1)). Por simplicidad, en el análisis siguiente usaremos un índice de olvido igual al 10%.

Para acelerar la convergencia, la red medirá el índice de olvido en 25 clases de repeticiones. Estas clases se definen por (1) cinco categorías de dificultad: 1-1,5, 1,5-2,5, 2,5-3,5, 3,5-5, y más de 5, y (2) cinco categorías de intervalo: 1-5, 5-20, 20-100, 100-500 y más de 500 días. Denotaremos las mediciones del índice de olvido para estas categorías como FI(D m,I n). Además, se medirá el índice de olvido general FI tot y se usará en la corrección de error de estabilidad.

El objetivo final es alcanzar un índice de olvido del 10% en todas las categorías. La siguiente fórmula se usará en la corrección de error para la estabilidad:

(7) FI opt(m,n)=(10*FI tot+Casos(m,n)*FI(m,n))/(10+Casos(m,n))

donde:

  • FI opt(m,n) es el índice de olvido usado en la corrección de error tras una repetición perteneciente a la categoría (m,n)
  • FI tot es el índice de olvido general medido en las repeticiones
  • Casos(m,n) es el número de casos de repetición usados para medir el índice de olvido en la categoría (m,n)

La fórmula de la Ec. (7) tiene como objetivo desplazar el peso de la corrección de error desde el índice de olvido general hacia el índice de olvido registrado en categorías específicas a medida que aumenta el número de casos en cada categoría. Obviamente, para Casos(m,n)=0, tenemos FI opt(m,n)=FI tot. Para Casos(m,n)=10, los pesos del FI general y del FI por categoría se equilibran, y para un número grande de casos, FI opt(m,n) se aproxima a FI(m,n).

La siguiente tabla ilustra la relación asumida entre FI opt(m,n), las calificaciones y la corrección de intervalo aplicada:

Calificación012345
FI opt(m,n)>10%40%60%80%sin correcciónsin correcciónsin corrección
FI opt(m,n)=10%sin correcciónsin correcciónsin correcciónsin correcciónsin correcciónsin corrección
FI opt(m,n)<10%sin correcciónsin correcciónsin corrección110%120%130%

En SuperMemo, las calificaciones inferiores a 3 se interpretan como olvido, mientras que las calificaciones iguales o superiores a 3 se entienden como recuerdo suficiente. Por eso no se aplica corrección para calificaciones aprobatorias cuando el FI es satisfactorio, ni se aplica corrección para calificaciones suspensas si el FI es mayor que el solicitado. Un ejemplo de corrección para una tasa de olvido excesiva y calificación=2 con un intervalo aplicado de 10 días sería del 80%. En consecuencia, se indicará a la red que asuma Intervalo=8 como correcto. La estabilidad correcta se derivaría entonces de S=-8/ln(0,9) y se usaría en la corrección de error. Los valores de las correcciones de intervalo son arbitrarios, pero no deben socavar la convergencia de la red. En caso de problemas de estabilidad poco probables, las correcciones podrían reducirse (nótese que el ruido ambiental en el proceso de aprendizaje superará con creces el impacto de una elección poco eficaz de los factores de corrección). Correcciones similares se han aplicado en algoritmos sucesivos de SuperMemo con resultados alentadores.

Condiciones de contorno

Se impondrán las siguientes restricciones adicionales a la red neuronal para acelerar la convergencia:

  • el aumento del intervalo en dos repeticiones sucesivas debe ser de al menos 1,1 (en consecuencia, la dificultad no puede ser inferior a 1,1)
  • el aumento del intervalo no puede superar 8 tras la primera repetición, ni 4 en repeticiones posteriores
  • el primer intervalo debe estar entre 1 y 40 días
  • la medida de dificultad no puede exceder de 8

Estas condiciones no perjudicarán a la red, ya que se han demostrado, más allá de toda duda razonable, como ciertas en la práctica del uso de SuperMemo y sus implementaciones a lo largo de los últimos diez años.

Preentrenamiento

En la etapa de preentrenamiento, se usará la siguiente forma de las Ecs. (2) y (3):

(8) D i+1:=D i+(0.1-(5-G)*(0.08+(5-G)*0.02))

(9) S i+1:=S i*D i*(0.5+1/i)

Con D 1=3.5 y S 1=-3/ln(0.9).

La Ec. (8) se ha derivado de Algorithm SM-2 (véase la ecuación de E-Factor). La Ec. (9) se ha derivado aproximadamente de la Matriz OF en Algorithm SM-8. D 1=3.5 corresponde con el mismo ajuste en Algorithm SM-8. S 1=-3/ln(0.9) corresponde con el primer intervalo de 3 días y un índice de olvido del 10%. El valor de 3 días está cerca del promedio en un amplio espectro de estudiantes y dificultad del material de aprendizaje.El preentrenamiento también usará las condiciones de frontera mencionadas en el párrafo anterior.

Hubo múltiples problemas con la red neuronal: implementación, errores, convergencia, interferencia y cosas por el estilo. La única forma de estudiar la red de manera efectiva era conectarla al SuperMemo real y ver cómo funcionaba con datos reales. Se me ocurrió la idea de algoritmos conectables (plug-in) en una DLL. Así podíamos estudiar variantes algorítmicas en el mismo shell. Probamos Algorithm SM-2Algorithm SM-8 y ahora una red neuronal haría lo mismo. Lamentablemente, esa implementación en DLL resultó ser un paso demasiado ambicioso. Una vez que los entusiastas chicos se graduaron, pronto se dispersaron, encontraron trabajo en otros lugares, se casaron, y nunca tuve la oportunidad de probar el plug-in en mi propio aprendizaje en mi shell favorito de aquel entonces, que era SuperMemo 9 (también conocido como SuperMemo 98).

La red neuronal de SuperMemo fue un proyecto estudiantil con el único propósito de verificar la viabilidad de las redes neuronales en la repetición espaciada. No hace falta decir que las redes neuronales son una herramienta viable. Es más, todas las herramientas de optimización válidas imaginables, con suficiente refinamiento, están destinadas a producir resultados similares a los que hoy logra SuperMemo. En otras palabras, mientras el programa de aprendizaje sea capaz de converger rápidamente hacia el modelo óptimo y producir el nivel deseado de retención de conocimiento, la herramienta de optimización utilizada para lograr ese objetivo tiene una importancia secundaria.

Considerando la cantidad de problemas en etapas anteriores, dudo que un plug-in exitoso hubiera cambiado mi forma de pensar sobre las redes neuronales. Soy programador y un manitas, me gusta ver lo que creo. La red neuronal me pareció demasiado una caja negra. En cuanto al equipo, todos han tenido éxito en sus carreras hoy en día. Los chicos contribuyeron después a otros proyectos de SuperMemo. La juventud es creativa, la juventud es impredecible, y me alegro de que emprendiéramos el proyecto.

David Calinski y FullRecall

David Calinski (n. 1981) fue uno de los primeros y jóvenes entusiastas de SuperMemo en la década de 1990. Mostró un rico interés por el aprendizaje acelerado, la psicología, la psiquiatría y más allá.

Reconocí rápidamente su talento y esperaba reclutarlo para algunos proyectos de SuperMemo, incl. SuperMemo para Linux; sin embargo, a muchos genios les gusta caminar solos. En algún momento, cambió de SuperMemo a su propia aplicación (FullRecall, véase más adelante), y desde ese momento no abandonaría su proyecto.

Nuestras discusiones sobre redes neuronales comenzaron en 2001. David era fan de SuperMemo; sin embargo, también admitió que nunca había estudiado realmente el algoritmo. Esto dio lugar a una crítica:

No conozco los detalles exactos del algoritmo o algoritmos de SM (nunca me interesó demasiado), pero lo importante aquí es la idea principal. El algoritmo de SM recibe algunos datos (p. ej., número de repeticiones, dificultad del ítem, calificación actual, etc., etc.) y devuelve el próximo intervalo óptimo que calculó. Este algoritmo, aunque sea «inteligente» y se corrija a sí mismo de alguna manera, seguirá siendo tonto: no se corregirá más de lo que fue diseñado para hacerlo.

Tiene razón, Algorithm SM-17 está inherentemente ligado al modelo de dos componentes de la memoria a largo plazo, sin embargo, esto es un matrimonio feliz. El vínculo solo puede romperse con evidencia en contra que, hasta ahora, no ha aparecido en tres décadas.

La postura de David es totalmente justificable. Todo se reduce al modelado y al conocimiento previo. Para David, Algorithm SM-8 era complejo. Las redes neuronales parecen una forma sencilla de eliminar esa complejidad. Para mí, mi propio algoritmo es tan simple como la tabla de multiplicar. Esa diferencia en el modelado suele llevar a una divergencia cognitiva, y esto es algo bueno. ¡Sin esas diferencias, hoy sabríamos mucho menos sobre las redes neuronales en la repetición espaciada!

Le escribí a David en 2004: «Es poco probable que futuras mejoras al algoritmo usado en SuperMemo resulten en una mayor aceleración del aprendizaje. Sin embargo, todavía hay margen de mejora en el manejo de casos inusuales, como repeticiones dramáticamente retrasadas, presentación masiva, manejo de ítems cuyo contenido ha cambiado, manejo de conexiones semánticas entre ítems, etc. Curiosamente, es probable que el mayor progreso del algoritmo provenga de una mejor definición del modelo de la memoria humana a largo plazo. En particular, la función que describe los cambios en la estabilidad de la memoria para distintos niveles de recuperabilidad se está entendiendo cada vez mejor. Esto podría simplificar drásticamente el algoritmo. Los modelos más simples requieren menos variables, y esto facilita la optimización. El algoritmo basado en la estabilidad y la recuperabilidad de las trazas de memoria también podría dar como resultado un mejor manejo de ítems con baja recuperabilidad. Sin embargo, dado que los casos inusuales de ítems en el proceso de aprendizaje forman una minoría, y probar un nuevo algoritmo llevaría varios años, no está claro si semejante implementación llegará a emprenderse alguna vez».

David desarrolló su propia red neuronal, MemAid. Más tarde la convirtió en un producto comercial. El paso de gratuito a comercial fue difícil, ya que los usuarios suelen preferir una baja de precios, por razones obvias. A pesar de todos los altibajos, David persistió, y su espíritu de manitas y su pasión por la ciencia y la programación siempre le dieron ventaja. Al igual que Anki, intentó mantener su programa multiplataforma, lo que impuso ciertos límites y exigencias de simplicidad. En sus palabras: «Me encanta la velocidad y la ausencia de fronteras, la falta de dependencia de una sola solución, sistema, computadora, etc.»

Hoy FullRecall es gratuito. Véase el changelong.

Figura: Distribución de intervalos en FullRecall. Repeticiones programadas con la ayuda de una red neuronal

El proyecto de código abierto MemAid cerró en 2006, pero FullRecall continuó. También lo hizo otro proyecto inspirado en MemAid: Mnemosyne. Mnemosyne, sin embargo, optó por su propia versión de Algorithm SM-2. Hasta el día de hoy, Mnemosyne genera datos que pueden ser usados por entusiastas o investigadores de la repetición espaciada en The Mnemosyne Project.

Al igual que Calinski, Peter Bienstman es escéptico respecto a los algoritmos más nuevos: «SuperMemo ahora usa SM-11. Sin embargo, somos algo escépticos de que la enorme complejidad de los algoritmos SM más nuevos aporte un beneficio estadísticamente relevante. Pero eso es uno de los hechos que esperamos descubrir con nuestra recopilación de datos.»

«Beneficio estadísticamente relevante» depende de los criterios. Para los usuarios, el algoritmo real puede ser secundario. Para la investigación, Algorithm SM-17 es una mina de oro (tanto como los datos que pueden generar todos los programas como Mnemosyne).

¿Por qué la red neuronal de FullRecall es defectuosa?

Las dos variables de memoria son a la vez necesarias y suficientes para representar una memoria atómica en la repetición espaciada. Además, las dos variables pueden usarse para explicar el efecto de espaciado en la presentación masiva. También pueden explicar el beneficio de un índice de olvido alto para la retención a largo plazo, como se discute aquí. Esas dos variables de la memoria a largo plazo, que llamamos estabilidad y recuperabilidad, son necesarias para representar el estado de la memoria. Cualquier red neuronal que quiera encontrar patrones en la relación entre el espaciado y el recuerdo debe recibir en su entrada el estado completo de la memoria; de lo contrario, nunca calculará el espaciado óptimo. Ese estado puede tener la forma del historial completo de repeticiones. También puede ser el par estabilidad : recuperabilidad (si se puede calcular). También puede ser cualquier otro código sobre el historial de repeticiones a partir del cual se pueda calcular el estado de la memoria.

El diseño de la red de FullRecall no cumple esos criterios:

  • entrada: last_interval_computed_by_ann [0-2048 días] (cero si no es un repaso, sino la primera presentación)
  • entrada: real_interval_since_last_review [0-2048 días] (mismo comentario que arriba)
  • entrada: number_of_repetitions_of_an_item_so_far [0-128]
  • entrada: current_grade [0-5, 5 es la mejor]
  • salida que nos da la RNA: new_interval [0-2048]

Ni el intervalo ni el número de repeticiones pueden reflejar la estabilidad o la recuperabilidad de la memoria. Se pueden obtener recuentos altos de repeticiones en la presentación masiva sujeta al efecto de espaciado con un aumento insignificante en la estabilidad de la memoria. Al mismo tiempo, intervalos largos con programaciones subóptimas pueden dar como resultado valores bajos tanto de estabilidad como de recuperabilidad. En resumen, para el mismo intervalo, el estado de la memoria dependerá de la distribución de las repeticiones en el tiempo.

Esto se puede mostrar con un ejemplo: para 10 repeticiones y 1000 días, 9 repeticiones en 9 días combinadas con un intervalo de 991 días producirán una estabilidad que se acerca a cero (asumiendo que no hay interferencia). Al mismo tiempo, para el mismo par de entradas, una repetición espaciada de forma óptima puede aportar una recuperabilidad de casi el 100% y una estabilidad que permite intervalos óptimos cercanos a los 1000 días.

El único escenario en el que la red podría funcionar bien es aquel en el que el usuario se ciñe con precisión al programa óptimo de repetición espaciada. Esto, a su vez, solo puede provenir de una red que haya sido preentrenada, p. ej. con Algorithm SM-2. En este escenario, la red será inestable y no convergerá hacia el óptimo, debido a que todas las desviaciones respecto al programa óptimo, incluidas las causadas por el error de la propia red, desplazarán el estado de la red lejos del estado original en el que aún era capaz de calcular el estado de la memoria a partir de sus entradas.

La estabilidad y la recuperabilidad son suficientes en el caso idealizado de una asociación monosináptica unitaria. En la vida real, es probable que la red semántica implicada en la asociación involucre varias de esas memorias unitarias ideales. Por eso SuperMemo usa el concepto de dificultad absoluta del ítem. En Algorithm SM-17, la dificultad absoluta del ítem se determina por el aumento máximo de la estabilidad de la memoria en la primera revisión programada de forma óptima con el índice de olvido predeterminado del 10%. La red de FullRecall tampoco recibe ninguna medida fiable de la dificultad del ítem. Esto agravará la ineficiencia de la red.

Según los informes de los usuarios, se dice que la red de FullRecall funciona bastante bien. A la luz del presente análisis, la red podría estar empleando condiciones de frontera bien elegidas; sin embargo, esto equivaldría a volver a Algorithm SM-2, empleado en versiones más antiguas de SuperMemo. No hace falta decir que ese antiguo algoritmo de SuperMemo está más sesgado y es menos plástico que las versiones algebraicas más nuevas basadas en matrices empleadas en SuperMemo.

Si la red de FullRecall se preentrena, p. ej. con la ayuda de Algorithm SM-2, y el estudiante se ciñe rigurosamente a su repetición, la red podría funcionar bien, ya que el intervalo se correlaciona bien con la estabilidad de la memoria, especialmente si la información se complementa con el número de repeticiones. Sin embargo, sin las condiciones de frontera adecuadas, en la lectura incremental, la red seguramente fallaría, ya que podría recibir información falsa sobre el estado de la memoria. Dependiendo del escenario, el mismo par Repeticiones : Intervalo puede darse tanto para Estabilidad=0 como para la estabilidad máxima correspondiente a recuerdos de toda la vida. De manera similar, la recuperabilidad también puede variar en el rango 0-1 para el mismo par de entradas en la red. Por ejemplo, un repaso frecuente de subconjuntos antes de un examen, seguido de una pausa más larga en el aprendizaje (p. ej. causada por una sobrecarga), puede corresponder a una estabilidad y recuperabilidad muy bajas, a pesar de proporcionar la misma entrada que una serie de repasos espaciados correctamente ejecutados en el mismo período (con alta estabilidad y recuperabilidad por encima de 0.9). En la lectura incremental, la sobrecarga, el aplazamiento automático, el avance de ítems, el repaso de subconjuntos y el efecto de espaciado serían invisibles para la red.

Suponiendo un buen diseño, los defectos de FullRecall solo se manifestarán en el aprendizaje intermitente, que puede activar condiciones de frontera. Esto no debería restar valor al software en sí. Solo sirve para enfatizar que el diseño de redes neuronales no es fácil y puede resultar inferior.

En resumen, sus entradas no reflejan toda la información necesaria para calcular los intervalos óptimos. En particular, el recuento de repeticiones es una medida muy pobre de la estabilidad o la recuperabilidad de la memoria. Un mejor enfoque sería codificar todo el historial de repeticiones o calcular el estado de la memoria con el uso de las variables de estabilidad y recuperabilidad. Tanto la estabilidad como la recuperabilidad deben poder calcularse a partir de la entrada de la red.

El futuro de las redes neuronales en SuperMemo

En nuestras discusiones con Calinski (en 2001), resumí mis reservas y juré continuar por el mismo viejo camino «conservador». 17 años después, me alegro. No ha habido mucho progreso en el área de emplear redes neuronales en la repetición espaciada. Podría ser el hecho de que el propio SuperMemo sea un inhibidor del progreso. Mientras tanto, sin embargo, Algorithm SM-17 ha revelado un mayor potencial de mejora en la repetición espaciada y en la comprensión de la memoria humana. Si el tiempo lo permite, todavía habrá progreso.

SuperMemo continuará con sus algoritmos algebraicos por las siguientes razones:

  • Modelo conocido: Las redes neuronales son superiores en los casos en que no conocemos el modelo subyacente de los fenómenos que se mapean. El modelo del olvido es bien conocido y facilita el ajuste fino de los métodos de optimización algebraica usados para calcular los intervalos entre repeticiones. El modelo bien conocido también hace que SuperMemo sea resistente a conjuntos de datos desequilibrados, que podrían afectar a las redes neuronales, especialmente en las etapas iniciales del aprendizaje. Por último, pero no menos importante, la validez del modelo de dos componentes de la memoria se ha demostrado de muchas maneras, y renunciar al modelo al diseñar la red, en nombre de frenar el prejuicio, sería un desperdicio. Ese enfoque solo podría tener valor de investigación
  • Sobreaprendizaje: Debido al cambio ponderado por casos en los valores de las matrices, las matrices de optimización usadas en SuperMemo no están sujetas a «sobreaprendizaje». No se necesita preentrenamiento, ya que la forma aproximada de la función de intervalos óptimos se conoce de antemano. No hay problema de representación de datos, ya que toda entrada de datos irregular se «irá compensando» con el tiempo
  • Equivalencia: Matemáticamente hablando, para funciones continuas, las redes de n entradas son equivalentes a las matrices de n dimensiones al mapear funciones con n argumentos, salvo por el «problema de resolución de argumentos». El alcance del problema de resolución de argumentos, es decir, el número finito de rangos de valores de los argumentos, depende en gran medida de la función. Un vistazo rápido a las matrices de optimización que muestra SuperMemo indica que la «resolución de argumentos» es mucho mejor de lo que realmente se necesita para este tipo particular de función, especialmente a la luz del considerable «ruido» en los datos. Los algoritmos de ascenso de colina (hill-climbing) usados en SuperMemo recuerdan a los algoritmos destinados a reponderar las redes
  • Investigación: El uso de matrices en SuperMemo facilita ver «la memoria en acción». Las redes neuronales no son tan observables. No revelan sus hallazgos de forma efectiva. No se puede ver cómo una sola curva de olvido afecta la función de los intervalos óptimos. Esto significa que la naturaleza de caja negra de las redes neuronales las hace menos interesantes como herramienta de investigación de la memoria
  • Convergencia: La complejidad del algoritmo no resulta de la complejidad del modelo de memoria. La mayor parte de la complejidad proviene del uso de herramientas destinadas a acelerar la convergencia del procedimiento de optimización sin poner en riesgo su estabilidad. Este ajuste fino solo es posible gracias a nuestro buen conocimiento del modelo de memoria subyacente, así como a los datos de aprendizaje reales recopilados a lo largo de los años, que nos ayudan a determinar con precisión la mejor función de aproximación para los componentes individuales del modelo
  • Curva de olvido: La única forma de determinar el intervalo óptimo para un índice de olvido dado es conocer la curva de olvido (aproximada) para una clase de dificultad y una estabilidad de memoria determinadas. Si una red neuronal no intenta mapear la curva de olvido, siempre oscilará alrededor del valor del intervalo óptimo (con buenas calificaciones aumentando ese valor, y malas calificaciones disminuyéndolo). Debido al ruido de los datos, esto es solo un problema teórico; sin embargo, ilustra el poder de usar una representación simbólica de la relación estabilidad-recuperabilidad-dificultad-tiempo en lugar de un número virtualmente infinito de posibles conjuntos de datos de curvas de olvido. Si la red neuronal no usa un mapeo ponderado de la curva de olvido, nunca convergerá. En otras palabras, seguirá oscilando alrededor del modelo óptimo. Si la red neuronal pondera el historial de estado y/o emplea la curva de olvido, adoptará el mismo enfoque que el algoritmo actual de SuperMemo, que era precisamente lo que la red debía evitar en primer lugar

En otras palabras, las redes neuronales podrían usarse para calcular los intervalos, pero no parecen ser la mejor herramienta en términos de capacidad de cómputo, valor de investigación, estabilidad y, sobre todo, velocidad de convergencia. Al diseñar una red neuronal óptima, nos topamos con dificultades similares a las de diseñar el procedimiento de optimización algebraica. Al final, cualesquiera que sean las condiciones de frontera establecidas en el SuperMemo «clásico», es probable que, tarde o temprano, aparezcan también en el diseño de la red (como se puede ver en: Neural Network SuperMemo).

Como con toda aproximación de funciones, la elección de la herramienta y ajustes algorítmicos menores pueden marcar una gran diferencia en la velocidad de convergencia y la precisión del mapeo. Las redes neuronales podrían ser útiles para mapear las funciones accesorias menos conocidas que se usan para acelerar la convergencia del algoritmo algebraico. Por ejemplo, hasta el día de hoy, el problema de estimar la dificultad del ítem no se ha resuelto por completo. Simplemente les decimos a los usuarios que mantengan su conocimiento simple, lo cual es una recomendación universal de cualquier educador consciente de los límites mnemotécnicos de la memoria humana.

1999: Elegir el nombre: «repetición espaciada»

En busca de un buen nombre único

El término » repetición espaciada » es muy antiguo y se ha usado durante décadas en la industria publicitaria y en la investigación conductual. Sin embargo, su significado moderno, basado en los intervalos de repaso óptimos, se estableció solo cuando el nombre se usó para representar el método SuperMemo (a partir de 1999).

En los primeros días de SuperMemo World, buscamos activamente un término científico bien reconocido para usar al referirnos al » método SuperMemo» en contextos científicos. La estrategia de marketing de la empresa era alejarse de un » programa desarrollado por un estudiante» hacia un » programa basado en un método científico«. Lamentablemente, la literatura sobre memoria y aprendizaje era escasa en publicaciones más allá de estudios a corto plazo del efecto de espaciado, con la notable excepción de la investigación de H. Bahrick sobre la retención de vocabulario en español.

Los investigadores de la memoria han estudiado varios » programas de repetición» durante mucho tiempo. A veces usaban intervalos de minutos. A veces usaban » ítems intercalados» para separar los repasos. Tres patrones de repaso han sido los más predominantes: (1) masivo, con muchas repeticiones en poco tiempo, (2) distribuido, con repeticiones dispersas en el tiempo, y (3) creciente, con un intervalo en aumento. La repetición espaciada se basa en un programa progresivamente creciente. A lo largo de décadas, la literatura sobre memoria no logró decidirse por un término específico para referirse al programa creciente. Pimsleur usaba intervalos graduados, Bjork usaba ensayo creciente, Baddeley usaba práctica distribuida, en mi tesis de maestría usé programa progresivo, Pavlik usa el más general programa óptimo, que sabemos que es progresivo, etc.

Un artículo seminal de Frank N. Dempster, » The Spacing Effect A Case Study in the Failure to Apply the Results of Psychological Research» (American Psychologist, 43, 627-634, 1988), dio un impulso temprano a SuperMemo. El artículo lamentaba el hecho de que los educadores ignoraran el efecto de espaciado en la práctica del aprendizaje. SuperMemo podía llenar ese vacío al proporcionar una herramienta universal y sencilla para el aprendizaje espaciado. Dempster usaba libremente términos como «presentación espaciada», «repasos espaciados», «práctica espaciada», «pruebas espaciadas» e incluso «lecturas espaciadas», o «presentaciones bien espaciadas».

Elegimos el término » espaciado de repetición» para usarlo en lugar de » el método SuperMemo«. El primer artículo académico en inglés que describía la repetición espaciada computacional (1994) todavía usaba el término » espaciado de repetición«.

Elegir el nombre: repetición espaciada

El 3 de febrero de 1999, inspirado por un correo electrónico de un usuario de SuperMemo ( Tony D’Angelo), revisé la literatura usando la palabra clave » spaced repetition«. Tras esa revisión, me convencí de que deberíamos pasar de usar el término » espaciado de repetición» a » repetición espaciada«. El término » repetición espaciada» era igualmente oscuro y poco usado, pero tenía un mayor número de usos que » espaciado de repetición«.

Decidimos que, en los futuros SuperMemos, el término » repetición espaciada» se usaría en lugar de » espaciado de repetición«. El primer uso del término en supermemo.com probablemente ocurrió el 4 de febrero de 2000 en SuperMemo is useless

Con el tiempo, el término » repetición espaciada» se ha vuelto cada vez más popular. En ese sentido, SuperMemo también puede atribuirse el mérito de haber logrado que este término científico genérico arraigara en la mente del público con una asociación específica a los intervalos óptimos en el aprendizaje.

El futuro del nombre: repetición espaciada

A partir de 1999, en gran parte debido a nuestra elección del nombre, el término » repetición espaciada » ha consolidado su presencia en los textos que se refieren a aplicaciones de tarjetas de memoria (flashcards), incl. las basadas en el sistema Leitner. También existe la esperanza de que el término se vuelva dominante en la literatura científica. Todos los autores prefieren mantener la terminología que han usado durante años o décadas. Sin embargo, gran parte de la aceleración terminológica puede atribuirse a Wikipedia. El término dominante allí es spaced repetition, sin embargo, los científicos de la memoria tienden a agruparse en torno a spaced retrieval o distributed practice (que es un concepto más amplio). También hay entradas aisladas como spaced learning, que han sido atribuidas por bots de spam a Paul Kelly (en su momento director de Monkseaton High School).

Esta confusión contribuye a la desconexión entre la investigación y las aplicaciones populares de la repetición espaciada, pero la fusión y unificación son solo cuestión de tiempo. Wikipedia usa un concepto de fusiones propuestas. Los científicos pueden oponerse a fusionar sus versiones «limpias» con la versión popular salpicada de enlaces comerciales. Sin embargo, tal fusión es inevitable y positiva. Hoy existen científicos que investigan la repetición espaciada y que no conocen el término spaced repetition, y que nunca han oído hablar de SuperMemo. También hay ingenieros que trabajan en algoritmos de repetición espaciada que saben muy poco sobre la investigación real de la memoria en este campo. Ambos problemas pueden reducirse unificando la terminología. Google hará el resto.

La unificación de la terminología bajo el estandarte de » repetición espaciada» beneficiará tanto a la investigación futura como a las aplicaciones populares

2005: Función de aumento de estabilidad

¿Por qué una idea sencilla no pudo materializarse?

Una descripción matemática perfecta de la memoria a largo plazo está prácticamente a la vuelta de la esquina. Puede parecer sorprendente hoy, pero, a pesar de su simplicidad, se necesitaron tres largas décadas de arranques y detenciones antes de que pudiera surgir un buen modelo. En los esfuerzos humanos, la ciencia suele ser un efecto secundario de la curiosidad humana, mientras que otros proyectos urgentes suelen recibir prioridad. El problema con la ciencia es que es ciega: revela pocos de sus secretos antes de que sean descubiertos. La moraleja de la historia es que todos los gobiernos y empresas deberían invertir todos los recursos posibles en buena ciencia. La ciencia es un poco como SuperMemo: hoy parece que la recompensa es pequeña, pero a largo plazo los beneficios pueden ser asombrosos.

Hoy podemos describir la memoria de manera casi perfecta con el conjunto de herramientas empleado en Algorithm SM-17. El único límite para seguir avanzando en la comprensión de la memoria es la imaginación, la disponibilidad de tiempo y la capacidad de plantear las preguntas correctas. Tenemos todas las herramientas y tenemos muchos datos. Incluso tenemos una buena porción de datos combinados con registros de sueño que ahora pueden añadir una nueva dimensión al modelo: la disposición homeostática para el aprendizaje, la fatiga homeostática e incluso el factor circadiano.

Una moraleja importante de la historia detrás de SuperMemo es que, si tienes una idea, hazla realidad (a menos que tengas otra idea mejor). El problema con las ideas es que a menudo pueden parecer una fracción de lo atractivas que en verdad son. Grafiqué mi primera curva de olvido en 1984, la olvidé a los pocos meses y recordé ese hecho 34 años después, en un momento en que toda mi vida gira en torno a las curvas de olvido. ¡Imagina la sorpresa! Cuando se me ocurrió el primer algoritmo de repetición espaciada, me tomó más de 2 años decidirme a reclutar al primer usuario. Sin Tomasz Kuehn, SuperMemo para Windows podría haber llegado de 2 a 4 años más tarde. Sin Janusz Murakowski, unos datos masivos vitales, el registro del historial de repeticiones en SuperMemo, podrían haberse retrasado de 1 a 2 años. Cuando la lectura incremental nació en el año 2000, solo yo sabía que era algo monumental. Sin embargo, me tomó bastante tiempo apreciar la magnitud de ese hecho. Hoy sé que la creatividad neuronal es una herramienta revolucionaria, pero todavía la uso a medias y no tan a menudo como su alternativa más simple: el repaso de subconjuntos.

1990: Primer indicio

Algorithm SM-17 estuvo en gestación durante casi un cuarto de siglo. Mientras preparaba materiales para este artículo, en mi archivo encontré una imagen de una matriz llamada «nueva fuerza» (new strength) con filas marcadas como «fuerza» (strength) y columnas marcadas como «durabilidad» (durability). Estos eran los nombres originales de la estabilidad y la recuperabilidad usados entre 1988 y 1990. Como un viejo fósil, ese documento me dice que la idea de Algorithm SM-17 debió de nacer alrededor de 1990.

Figura: Una imagen de una matriz llamada «nueva fuerza» (new strength) con filas marcadas como «fuerza» (strength) y columnas marcadas como «durabilidad» (durability). Estos eran los nombres originales de la estabilidad y la recuperabilidad usados entre 1988 y 1990. El documento sugiere que la idea de Algorithm SM-17 debió de nacer alrededor de 1990.

Desde los primeros inicios del modelo de dos componentes de la memoria, quise construir un algoritmo en torno a él. Mi motivación siempre fue tibia. SuperMemo funcionaba lo bastante bien como para que esto fuera solo un pulcro ejercicio teórico. Sin embargo, hoy veo que el algoritmo proporciona datos para un modelo que puede responder muchas preguntas sobre la memoria. Algunas de esas preguntas en realidad nunca se han formulado (p. ej. sobre los subcomponentes de la estabilidad). Esto también es similar al propio SuperMemo. Siempre ha tenido dificultades porque su valor es difícil de apreciar en teoría. Los efectos prácticos son lo que más fácilmente cambia la opinión de los buenos estudiantes.

1993: Distracción

En 1993, mi propia forma de pensar era un inhibidor del progreso. Explorar más a fondo el algoritmo era secundario. No beneficiaría tanto al usuario. El modelado de la memoria era pura investigación de horizonte lejano (blue sky research). Véase: La futilidad de afinar el algoritmo. En ese momento fue Murakowski quien más presionó por el progreso. Seguía quejándose de que » SuperMemo sigue filtrando datos con valor de Premio Nobel«. Me gritaba con palabras que rozaban el insulto: » ¡implementa ya los historiales de repetición!«. Era, sencillamente, una batalla de prioridades. Teníamos una nueva versión de SuperMemo para Windows, la llegada de los datos de audio, la llegada de la tecnología CD-ROM, la llegada de una competencia sólida, incl. en casa, donde Young Digital Poland nos ganó el título del primer CD-ROM en nuestro país por apenas un mes. Aún nos enorgullecemos de reclamar el primer CD-ROM para Windows en Polonia. En realidad, todavía se producía en Estados Unidos, pero el contenido se hizo enteramente en Polonia, con un SuperMemo 100% polaco.

1996: Capital de riesgo

En febrero de 1996, se despejaron todos los obstáculos y SuperMemo finalmente comenzó a recopilar datos completos del historial de repeticiones (en ese momento, todavía era una opción, para evitar saturar sistemas más limitados con datos sin usar). Mis propios datos ahora se remontan en gran parte a 1992-1993, ya que todos los ítems de febrero de 1996 aún tenían su última repetición fácilmente identificable a partir del intervalo. Incluso tengo bastantes historiales que se remontan a 1987. En mi obsesión por los datos, registré manualmente el progreso de algunos ítems específicos y más tarde pude completar los historiales de repetición mediante edición manual. Por lo tanto, mis propios datos son ahora el historial de repetición más extenso que existe en la repetición espaciada. 30 años de datos con una cobertura masiva de 22 a 25 años de aprendizaje. Es una mina de oro.

El 29 de septiembre de 1996, domingo, por la noche, dediqué dos horas a esbozar el nuevo algoritmo basado en el modelo de dos componentes de la memoria. Todo parecía muy sencillo y que requería poco trabajo. SuperMemo apenas había comenzado a recopilar historiales de repetición, así que debería tener muchos datos a mano. Nuestro enfoque cambió de los cursos multimedia, como Cross Country, a proyectos más sencillos, como Advanced English. Parecía un buen momento. Lamentablemente, al día siguiente recibimos una llamada de Antek Szepieniec, quien había hablado con inversores en Estados Unidos con el sueño de convertir a SuperMemo World en la primera empresa polaca en el NASDAQ. Profetizó con entusiasmo su convicción de que había una buena posibilidad de una inyección de varios millones de dólares en nuestros esfuerzos por parte de capital de riesgo. Eso instantáneamente me arrojó a nuevos roles y nuevos trabajos. De las cosas malas, esto retrasó Algorithm SM-17 dos décadas. De las cosas buenas, el concepto de Hypermedia SuperMemo, también conocido como Knowledge Machine, también conocido como lectura incremental, ganó un gran impulso en cuanto a teoría y diseño. La práctica volvió a vencer a la ciencia.

2005: Enfoque teórico

En el año 2000, con la lectura incremental, y luego en 2006 con la cola de prioridad, la necesidad de retrasar repeticiones y la necesidad de repasos anticipados aumentaron drásticamente. Esto exigía enormes desviaciones respecto al óptimo. El antiguo Algorithm SM-8 no podía manejar eso de forma efectiva. La función de los intervalos óptimos tuvo que expandirse a la dimensión del tiempo (es decir, la recuperabilidad). Necesitábamos una función de aumento de estabilidad.

Una de las dinámicas más interesantes del progreso en la ciencia es que las exploraciones dendríticas de la realidad a menudo requieren una masa cerebral crítica para impulsar una nueva idea. En 2005, Biedalak y otros estaban en gran parte fuera del circuito, ocupados promocionando SuperMemo como negocio. Yo estaba en camino hacia un gran avance en la lectura incremental: el manejo de la sobrecarga. Con la aparición de Wikipedia, de repente resultó que importar toneladas de conocimiento requería poco esfuerzo, pero el conocimiento de baja prioridad podía fácilmente abrumar al de alta prioridad por puro volumen. Así, la riqueza socava la calidad del conocimiento. Mi solución al problema fue emplear la cola de prioridad. No se implementaría hasta 2006. Mientras tanto, Gorzelańczyk y Murakowski estaban ocupados con sus propios proyectos científicos.

Gorzelańczyk solía asistir a una conferencia de cibernética en Cracovia impulsada por mi primera inspiración, el Prof. Ryszard Tadeusiewicz. Para su presentación de 2005, Gorzelańczyk sugirió que actualizáramos nuestro modelo de memoria. Con el diluvio de nuevos datos en biología molecular, una década desde la última formulación podía marcar una gran diferencia. Pensé que mis ideas para encontrar una fórmula que explicara la formación de la estabilidad de la memoria serían un buen complemento. Esta chispa inicial pronto cobró impulso en los intercambios con Murakowski. Sin esos tres cerebros trabajando en conjunto y avivando el entusiasmo, no se habría dado el siguiente paso obvio. Usando las herramientas empleadas por primera vez en el modelo del aprendizaje intermitente de 1990, decidí averiguar la función para el aumento de estabilidad. Una vez que mi computadora empezó a procesar datos, siguieron llegando datos curiosos e interesantes de forma continua. El trabajo debía llevar solo unas pocas noches. Al final, llevó medio invierno.

2013: El renacer de la visión de conjunto

Al igual que en 2005, en 2013 la masa cerebral crítica tuvo que acumularse para impulsar las nuevas soluciones. Sin embargo, debo dar la mayor parte del crédito a Biedalak. Fue él quien inclinó la balanza. En una batalla sin fin por el reconocimiento del liderazgo y las reivindicaciones pioneras de SuperMemo, exigió que siguiéramos adelante con el proyecto y me envió a unas breves vacaciones creativas para completarlo. Debía ser solo un proyecto de invierno, y resultó ser de dos años, y todavía consume mucho de mi tiempo.

El 9 de noviembre de 2014, hicimos una caminata de 26 km para discutir el nuevo algoritmo. Caminar y hablar (walktalking) es nuestra mejor forma de lluvia de ideas, que siempre da grandes frutos. Al día siguiente, nos reunimos en una piscina junto con Leszek Lewoc, adorador de los big data, que siempre tiene una gran cantidad de ideas fantásticas (conocí a Lewoc por primera vez en 1996, y su esposa probablemente fue usuaria de SuperMemo ya en 1992 [verify!]). Las conclusiones sencillas de esa sesión de lluvia de ideas fueron usar el modelo de dos componentes de la memoria para simplificar el enfoque del algoritmo, simplificar la terminología y hacerla más amigable para los humanos (se acabaron los A-Factors, los U-Factors, los R-Factors, etc.).

Aumento de la estabilidad de la memoria con el repaso

Para entender Algorithm SM-17, es útil comprender los cálculos usados para averiguar la fórmula del aumento de la estabilidad de la memoria. En 2005, nuestro objetivo era encontrar la función del aumento de estabilidad para cualquier nivel válido de R y S: SIncf(R,S). Los objetivos y las herramientas eran bastante similares a los usados en la búsqueda para construir el modelo del aprendizaje intermitente (1990).

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Hasta 2005, no fuimos capaces de formular una fórmula universal que vinculara una repetición con un aumento de la estabilidad de la memoria. Los algoritmos de espaciado de repetición se basaban en una comprensión general de cómo aumenta la estabilidad cuando se usan los llamados intervalos óptimos entre repeticiones (definidos como intervalos que producen una tasa de recuerdo conocida que suele superar el 90%). El término intervalo óptimo se usa para la aplicabilidad de un intervalo en el aprendizaje. Dichos algoritmos de espaciado de repetición también permiten determinar una función precisa de aumento de estabilidad para intervalos óptimos en forma de matriz. Sin embargo, se sabía poco sobre el aumento de estabilidad para niveles bajos de recuperabilidad (es decir, cuando los intervalos no son óptimos). Con los datos recopilados con la ayuda de SuperMemo, ahora podemos intentar llenar este vacío. Aunque SuperMemo ha sido diseñado para aplicar los intervalos óptimos en el aprendizaje, en situaciones de la vida real los usuarios a menudo se ven obligados a retrasar las repeticiones por diversas razones (como vacaciones, enfermedad, etc.). Esto proporciona una dosis sustancial de repeticiones con menor recuperabilidad en casi todo cuerpo de material de aprendizaje. Además, en 2002, SuperMemo introdujo el concepto de repetición a mitad de intervalo, que permite acortar los intervalos entre repeticiones. Aunque la proporción de repeticiones a mitad de intervalo en cualquier conjunto de datos es muy pequeña, para muestras de datos suficientemente grandes, el número de casos de repetición con recuperabilidad muy baja y muy alta debería permitir generalizar el hallazgo sobre el aumento de la estabilidad de la memoria desde la recuperabilidad de 0.9 hasta todo el rango de recuperabilidad.

Para construir de manera óptima la estabilidad de la memoria a través del aprendizaje, necesitamos conocer la función de los intervalos óptimos, o, alternativamente, la función del aumento de estabilidad ( SInc). Estas funciones toman tres argumentos: estabilidad de la memoria (S)recuperabilidad de la memoria (R) y dificultad del conocimiento (D). Tradicionalmente, SuperMemo siempre se ha centrado en las dimensiones S y D, ya que mantener alta la recuperabilidad es el criterio principal del procedimiento de optimización usado para calcular los intervalos entre repeticiones. El enfoque en S y D estaba dictado por las aplicaciones prácticas de la función de aumento de estabilidad. En el presente artículo, nos centramos en S y R, ya que intentamos eliminar la dimensión D analizando «conocimiento puro», es decir, trazas de memoria no compuestas que caracterizan un conocimiento fácil de aprender. Eliminar la dimensión D facilita nuestras divagaciones teóricas, y las conclusiones pueden extenderse más adelante a trazas de memoria compuestas y a conocimientos considerados difíciles de aprender. En otras palabras, a medida que pasamos de la práctica a la teoría, desplazamos nuestro interés del par (S,D) al par (S,R). En línea con este razonamiento, todos los conjuntos de datos investigados se han filtrado por dificultad del ítem. Al mismo tiempo, buscamos los conjuntos más grandes posibles en los que la representación de ítems con baja recuperabilidad fuera lo suficientemente grande como resultado de retrasos en el repaso (en violación del espaciado óptimo de las repeticiones). Hemos desarrollado un procedimiento de dos pasos que se usó para proponer una fórmula simbólica para el aumento de estabilidad en distintos niveles de recuperabilidad en conjuntos de datos caracterizados por una dificultad baja y uniforme (los llamados conjuntos de datos de conocimiento bien formulado, fáciles de retener en la memoria). El material de aprendizaje bien formulado y uniforme facilita destilar un proceso puro de consolidación de la memoria a largo plazo mediante el repaso. Como se analiza en otra parte de este artículo, el conocimiento mal formulado da lugar a la superposición de procesos de consolidación independientes y no es adecuado para el presente análisis.

Cálculo en dos pasos

En SuperMemo 17, es posible recorrer todo el registro del historial de repeticiones para recopilar datos de aumento de estabilidad. Esto permite graficar una representación gráfica de la matriz SInc[]. Esa matriz puede usarse luego en un esfuerzo por encontrar una aproximación simbólica de la función de aumento de estabilidad. Se usó el mismo razonamiento en 2005. Sin embargo, el procedimiento era mucho más simple. Esto puede usarse después para comprender mejor Algorithm SM-17:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

El procedimiento de dos pasos para determinar la función del aumento de la estabilidad de la memoria SInc:

  • Paso 1: Usar una representación matricial de SInc y un procedimiento iterativo para minimizar la desviación Dev entre las calificaciones en un proceso de aprendizaje real (datos) y las calificaciones predichas por SIncDev se define como una suma de R-Pass a lo largo de una secuencia de repeticiones de una pieza dada de conocimiento, donde R es la recuperabilidad y Pass es 1 para calificaciones aprobatorias y 0 para calificaciones reprobatorias
  • Paso 2: Usar un algoritmo de ascenso de colina (hill-climbing) para resolver un problema de mínimos cuadrados y evaluar candidatos simbólicos para SInc que proporcionen el mejor ajuste a la matriz SInc derivada en el Paso 1

Calcular el aumento de estabilidad

La matriz de aumento de estabilidad ( SInc[]) se calculó en el Paso 1. En 2005, podíamos tomar cualquier valor inicial hipotético plausible de SInc. Hoy, como conocemos la naturaleza aproximada de la función, podemos acelerar el proceso y hacerlo no iterativo (véase Algorithm SM-17).

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Definamos un procedimiento para calcular la estabilidad de la memoria para un patrón de repaso dado. Este procedimiento puede usarse para calcular la estabilidad a partir de las calificaciones conocidas obtenidas en el aprendizaje (variante práctica) y para calcular la estabilidad a partir únicamente del momento de las repeticiones (variante teórica). La única diferencia entre ambas es que la variante práctica permite corregir la estabilidad como resultado del olvido estocástico reflejado en las calificaciones reprobatorias.

En los siguientes pasajes usaremos la siguiente notación:

  • S(t) – estabilidad de la memoria en el momento t
  • S[r] – estabilidad de la memoria tras la r  repetición (p. ej., con S[1] representando la estabilidad de la memoria después de aprender una pieza nueva de conocimiento)
  • R(S,t) – recuperabilidad de la memoria para una estabilidad S y un tiempo t (sabemos que R=exp -k*t/S y que k=ln(10/9))
  • SInc(R,S) – aumento de estabilidad como resultado de un repaso para una recuperabilidad R y una estabilidad S tal que SInc(R(S,t),S(t))=S(t )/S(t’)=S[r]/S[r-1] (donde: t’ y t representan el momento del repaso, antes y después de la consolidación de la memoria, siendo t -t’ indistinguible de cero)

Nuestro objetivo es encontrar la función del aumento de estabilidad para cualquier nivel válido de R y S: SIncf(R,S).

Si tomamos cualquier valor inicial plausible de SInc(R,S), y usamos S[1]=S 1, donde S 1 es la estabilidad derivada de la función de decaimiento de la memoria tras el primer repaso de contacto (para el intervalo óptimo entre repeticiones), entonces, para cada historial de repetición, podemos calcular S usando la siguiente iteración:

r:=1;
S[r]:=S1
repeat
 t:=Interval[r]; // where: Interval[r] is taken from a learning process (practical variant) or from the investigated review pattern (theoretical variant)
 Pass:=(Grade[r]>=3); // where: Grade[r] is the grade after the r-th interval (practical variant) or 4 (theoretical variant)
 R:=Ret(S[r],t);
 if Pass then
    S[r+1]:=S[r]*SInc[R,S[r]]
    r:=r+1;
else begin
   r:=1;
   S[r]:=S1;
   end;
until (r is the last repetition)

En Algorithm SM-8, podemos usar el gráfico del primer intervalo para determinar S 1, que se acorta progresivamente después de cada calificación reprobatoria.

Comenzamos el proceso iterativo con un valor inicial hipotético de la matriz SInc[R,S], p. ej. con todas las entradas fijadas arbitrariamente al E-Factor como en Algorithm SM-2.

Luego podemos seguir usando el procedimiento anterior sobre los datos existentes del historial de repeticiones para calcular un nuevo valor de SInc[R,S] que proporcione una menor desviación respecto de las calificaciones obtenidas en el proceso de aprendizaje real (usamos las diferencias R-Pass para este propósito).

Son posibles mejoras incrementales si observamos que:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

  • si Pass=true y S[r]<Interval[r], entonces la entrada SInc[R,S[r-1]] está subestimada (y se puede corregir hacia Interval[r]/S[r]* SInc[R,S[r-1]])
  • si Pass=false y S[r]>Interval[r], entonces la entrada SInc[R,S[r-1]] está sobrestimada

Podemos iterar sobre SInc[] para acercar cada vez más su valor a la alineación con las calificaciones obtenidas en el proceso de aprendizaje. Este enfoque permite llegar al mismo SInc[R,S] final, independientemente del valor original de SInc[R,S] establecido en la inicialización

En Algorithm SM-17, en lugar del enfoque incremental de «todo o nada» (bang-bang) anterior, usamos curvas de olvido reales para proporcionar una mejor estimación de la recuperabilidad, que luego puede usarse para corregir la estabilidad estimada. La estimación final de estabilidad combina la predicción teórica de la recuperabilidad, el recuerdo real tomado de las curvas de olvido (ponderado según la disponibilidad de datos), y la calificación real combinada con el intervalo, como en el razonamiento anterior. Al combinar esas tres fuentes de información, Algorithm SM-17 puede proporcionar estimaciones de estabilidad/intervalo sin necesidad de iterar sobre la matriz SInc[] una y otra vez.

Fórmula simbólica para el aumento de estabilidad

Después de muchas iteraciones, obtenemos un valor de SInc que minimiza el error. El procedimiento es convergente. Con la matriz de aumento de estabilidad disponible, podemos buscar una fórmula simbólica que exprese el aumento de estabilidad.

Dependencia del aumento de estabilidad respecto a S

Como era previsible, SInc disminuye a medida que aumenta S :

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

En el Paso 2, usaremos la matriz SInc[R,S] obtenida aquí para obtener una fórmula simbólica de SInc.

Paso 2 – Encontrar SInc como fórmula simbólica

Ahora podemos usar cualquier algoritmo de descenso de gradiente para evaluar candidatos simbólicos para SInc que proporcionen el mejor ajuste a la matriz SInc derivada anteriormente.

Al inspeccionar la matriz SInc, vemos de inmediato que SInc como función de S para R constante se describe excelentemente con una función de potencia negativa, como en el conjunto de datos de ejemplo a continuación:

Lo cual queda aún más claro en la versión log-log del mismo gráfico:

La conclusión sobre la dependencia de potencia entre SInc y S anterior confirma los hallazgos previos. En particular, la disminución de los R-Factors a lo largo de las categorías de repetición en SuperMemo siempre se ha aproximado mejor con una función de potencia

Dependencia del aumento de estabilidad respecto a R

Como predice el efecto de espaciadoSInc es mayor para niveles más bajos de R . Nótese, sin embargo, que el procedimiento usado en 2005 podría haber introducido un artefacto: la supervivencia de una traza de memoria a lo largo del tiempo contribuiría linealmente a la nueva estimación de estabilidad. Esto es problemático debido a la naturaleza estocástica del olvido. Una mayor supervivencia de los recuerdos podría entonces ser cuestión de azar. En Algorithm SM-17, se usa más evidencia para estimar la estabilidad, y el intervalo de supervivencia se pondera junto con el resto de las pruebas.

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Cuando buscamos la función que refleja la relación entre SInc y R para S constante, vemos más ruido en los datos debido a que SuperMemo proporciona muchos menos aciertos con R bajo (su algoritmo suele intentar lograr R>0.9). Sin embargo, tras inspeccionar múltiples conjuntos de datos, concluimos que, de forma algo sorprendente, SInc aumenta exponencialmente cuando R disminuye (véase más adelante cómo este aumento resulta en una relación casi lineal entre SInc y el tiempo). La magnitud de ese aumento es mayor de lo esperado, y debería aportar más evidencia del poder del efecto de espaciado. Esa conclusión debería tener un impacto importante en las estrategias de aprendizaje.

Aquí hay un conjunto de datos de ejemplo de SInc como función de R para S constante. Podemos ver que SInc=f(R) puede aproximarse bastante bien con una función exponencial negativa:

Y la versión semi-log del mismo gráfico con una línea de tendencia de aproximación lineal cuya intersección se fija en 1:

Curiosamente, el aumento de estabilidad para una recuperabilidad del 100% puede ser menor que 1. Algunas investigaciones moleculares indican una mayor labilidad de los recuerdos en el momento del repaso. Esta es una prueba más de que la repetición intensiva (cramming) puede perjudicarte no solo por costarte tiempo extra.

Dependencia del aumento de estabilidad respecto a la recuperabilidad (2018)

A pesar de todas las diferencias y artefactos algorítmicos, la dependencia del aumento de estabilidad respecto a la recuperabilidad para el conocimiento bien formulado es casi idéntica a la derivada de datos producidos 13 años después por Algorithm SM-17.

Recordemos que en SuperMemo usamos curvas de olvido para proporcionar una mejor estimación de la recuperabilidad. Esto se usa luego para corregir la estabilidad estimada. Al combinar varias fuentes de información, Algorithm SM-17 puede proporcionar estimaciones de estabilidad más precisas. Todavía existe el viejo artefacto de la supervivencia de una traza de memoria que contribuiría linealmente a la nueva estabilidad. Este artefacto puede compensarse de forma paramétrica. Sin embargo, cada vez que SuperMemo intenta hacerlo, sus métricas de rendimiento caen.

A pesar de todas las mejoras, y de conjuntos de datos mucho más grandes (especialmente para R bajo), la dependencia del aumento de estabilidad respecto a la recuperabilidad para los ítems fáciles parece grabada en piedra.

Este panorama perfecto se desmorona cuando añadimos conocimiento difícil a la mezcla. Esto se debe en parte a la reducción del artefacto de supervivencia prolongada mencionado anteriormente. Por esa razón, los nuevos SuperMemos no se basan en esta fórmula de memoria aparentemente bien confirmada:

Figura: La fuerza de la memoria a largo plazo depende del momento en que se realiza el repaso. Para el conocimiento bien formulado, los retrasos largos en el repaso producen un gran aumento en la estabilidad de la memoria. El repaso óptimo debería equilibrar ese aumento con la probabilidad de olvido. En el gráfico presentado, la relación entre el aumento de estabilidad y el logaritmo de la recuperabilidad (log(R)) es lineal. Log(R) expresa el tiempo. Se usaron casi 27 000 repeticiones para trazar este gráfico. La estabilidad de la memoria observada antes del repaso abarcó de 2 a 110 días. Se observó un aumento máximo de casi 10 veces en la estabilidad para los niveles más bajos de recuperabilidad. La matriz de aumento de estabilidad se generó con Algorithm SM-17 en SuperMemo 17

Fórmula del aumento de la estabilidad de la memoria

Con la matriz de aumento de estabilidad disponible, pudimos buscar una expresión simbólica del aumento de estabilidad. La ecuación encontrada en 2005 se conocerá más adelante como Eqn. SInc2005. Nótese que las fórmulas usadas en Algorithm SM-17 son diferentes:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Para una dificultad de conocimiento constante, aplicamos un ajuste de superficie bidimensional para obtener la fórmula simbólica de SInc. Usamos un algoritmo de Levenberg-Marquardt modificado con varios posibles candidatos de función simbólica que podrían describir con precisión SInc como función de S y R. El algoritmo se mejoró con un bucle persistente de reinicio aleatorio para asegurar que se encontrara el máximo global. Obtuvimos los mejores resultados con la siguiente fórmula (Eqn. SInc2005):

SInca-b *e cRd

donde:

  • SInc – aumento de la estabilidad de la memoria como resultado de una repetición exitosa (cociente de la estabilidad S antes y después de la repetición)
  • R – recuperabilidad de la memoria en el momento de la repetición, expresada como la probabilidad de recuerdo en porcentaje
  • S – estabilidad de la memoria antes de la repetición, expresada como el intervalo que genera R=0.9
  • abcd – parámetros que pueden diferir ligeramente entre distintos conjuntos de datos
  • e – base del logaritmo natural

Los parámetros abcd variarían ligeramente entre distintos conjuntos de datos, y esto podría reflejar la variabilidad de la interacción usuario-conocimiento (es decir, distintos conjuntos de material de aprendizaje presentados a distintos usuarios pueden dar lugar a una distribución diferente de la dificultad, así como a criterios de calificación distintos que pueden afectar la medición final). A modo de ilustración, se encontró que un valor promedio de abcd tomado de varios conjuntos de datos era: a=76b=0.023c=-0.031d:=-2, con c variando poco de un conjunto a otro, y con a y d mostrando una varianza relativamente mayor. Véase el ejemplo: ¿Cómo usar la fórmula para calcular la estabilidad de la memoria?

Conclusiones derivadas de la fórmula del aumento de estabilidad

La fórmula anterior para el aumento de estabilidad difiere ligeramente de hallazgos posteriores. Por ejemplo, parece subestimar la disminución del aumento de estabilidad con S ( b bajo). Sin embargo, puede usarse para derivar una gran cantidad de conclusiones interesantes.

Aumento lineal del valor del repaso a lo largo del tiempo

Debido al efecto de espaciado, el potencial de aumento de la estabilidad de la memoria sigue creciendo con el tiempo de forma casi lineal:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

La fórmula anterior produjo valores de SInc que diferían en promedio un 15% de los obtenidos a partir de los datos en forma de la matriz SInc en conjuntos de datos homogéneos (es decir, conjuntos de historiales de repetición seleccionados para: un solo estudiante, un solo tipo de conocimiento, baja dificultad y un rango pequeño de A-Factors).

A medida que aumenta el intervalo entre repeticiones, a pesar de la doble exponenciación en el tiempo, SInc aumenta siguiendo una curva sigmoide casi lineal (ambas operaciones de exponenciación negativa se cancelan entre sí):

Figura: El gráfico de los cambios de SInc en el tiempo. Este gráfico se generó para S=240 usando la Ec. SInc2005.

La dependencia casi lineal de SInc respecto al tiempo se refleja en SuperMemo al calcular el nuevo intervalo óptimo multiplicando el O-Factor por el intervalo entre repeticiones realmente usado, y no por el intervalo óptimo calculado previamente (en SuperMemo, los O-Factors son entradas de una matriz bidimensional OF[S,D] que representan SInc para R=0.9).

Aumento esperado de la estabilidad de la memoria

La optimización del aprendizaje puede usar diversos criterios. Podemos optimizar para un nivel específico de recuerdo o para maximizar el aumento de la estabilidad de la memoria. En ambos casos, es útil comprender el nivel esperado de aumento de estabilidad.

Definamos el valor esperado del aumento de la estabilidad de la memoria como:

E( SInc)= SInc*R

donde:

  • R – recuperabilidad
  • SInc – aumento de estabilidad
  • E( SInc) – aumento probabilístico esperado de la estabilidad (es decir, el aumento definido por SInc y disminuido por la posibilidad de olvido)

La fórmula para el aumento de estabilidad derivada en 2005 produjo una gran sorpresa. Solíamos afirmar que la mejor velocidad de aprendizaje se podía lograr con un índice de olvido del 30-40%. La Ec. SInc2005 parecía indicar que una retención muy baja podía producir efectos de memoria bastante buenos. Debido a la escasez de datos con R bajo en 2005, estas conclusiones deben tomarse con cautela:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

A partir de la Ec. SInc2005 tenemos E( SInc)=( a-b *e cRd)*R. Al hallar la derivada d ESInc/dR e igualarla a cero, podemos encontrar la recuperabilidad que maximiza el aumento esperado de la estabilidad para distintos niveles de estabilidad:

Figura: Aumento esperado de la estabilidad de la memoria E(SInc) como función de la recuperabilidad R para la estabilidad S derivada de la Ec. ( SInc2005). Usando la terminología conocida por los usuarios de SuperMemo, el aumento máximo esperado de la estabilidad de la memoria para intervalos cortos ocurre con un índice de olvido ¡igual al 60%! Esto también significa que el índice de olvido máximo permitido en SuperMemo (20%) da como resultado un aumento esperado de la estabilidad casi un 80% menor que el máximo posible (si estuviéramos dispuestos a sacrificar niveles altos de retención).

Figura: Aumento esperado de la estabilidad de la memoria E(SInc) como función de la recuperabilidad R y la estabilidad S derivadas de la Ec. SInc2005

Complejidad de la memoria en la repetición espaciada

La estabilidad de la memoria en la repetición espaciada depende de la calidad del repaso, que a su vez depende de la complejidad de la memoria. Ya en 1984, expresé esto en mi propio aprendizaje en lo que más tarde se conocería como el principio de información mínima. Para un repaso efectivo, el conocimiento debe ser sencillo. Puede formar una estructura compleja, pero los recuerdos individuales sujetos a repaso deben ser atómicos. En 2005, encontramos una fórmula que rige el repaso de recuerdos complejos.

Georgios Zonnios fue en su día un adolescente curioso usuario de SuperMemo. Hoy es un innovador de la educación y un rico colaborador creativo de muchas de mis ideas. Él observó:

La estabilidad en la fórmula de la estabilidad de ítems complejos es como la resistencia en un circuito electrónico: muchas resistencias en paralelo permiten fugas de corriente

Curiosamente, en los primeros días de la lectura incremental, Zonnios llegó de forma independiente al concepto de escritura incremental, que hoy puede parecer un paso obvio al emplear las herramientas de la lectura incremental en la creatividad. Este artículo también se ha escrito por medio de la escritura incremental.

Así es como se describieron y analizaron en 2005 los recuerdos de ítems complejos:

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

La dificultad en el aprendizaje está determinada por la complejidad de la información recordada. El conocimiento complejo produce dos efectos:

  • mayor interferencia con otras piezas de información
  • dificultad para estimular de manera uniforme los subcomponentes de la traza de memoria en el momento del repaso

Ambos componentes de la dificultad pueden contrarrestarse aplicando una representación adecuada del conocimiento en el proceso de aprendizaje.

Veamos cómo la complejidad del conocimiento afecta la formación de la estabilidad de la memoria.

Imaginemos que queremos aprender lo siguiente: Marie Sklodowska-Curie fue la única ganadora del Premio Nobel de Química de 1911. Podemos adoptar dos enfoques: uno en el que el conocimiento se mantiene complejo, y otro con formulaciones sencillas. En una variante compleja, se podría formular un doble cloze con el fin de aprender el nombre de Marie Curie y el año en que recibió el Premio Nobel.

P: […] fue la única ganadora del Premio Nobel de Química de […]
R: Marie Sklodowska-Curie, 1911

En una variante sencilla, este doble cloze se dividiría, y el apellido de soltera polaco se haría opcional y se usaría para crear un tercer cloze:

P: […] fue la única ganadora del Premio Nobel de Química de 1911
R: Marie (Sklodowska-)Curie

P: Marie Sklodowska-Curie fue la única ganadora del Premio Nobel de Química de […](año)
R: 1911

P: Marie […]-Curie fue la única ganadora del Premio Nobel de Química de 1911
R: Sklodowska

Además, en la variante sencilla, un enfoque riguroso del aprendizaje requeriría formular dos eliminaciones cloze más, ya que Marie Curie también fue ganadora del Premio Nobel de Física de 1903 (además de otros premios):

P: Marie Sklodowska-Curie fue la única ganadora del Premio Nobel de Química de 1911 por […]
R: Química

P: Marie Sklodowska-Curie fue la única ganadora del […] de Química de 1911
R: Premio Nobel (de Química)

Consideremos ahora el doble cloze compuesto original. Para efectos del argumento, supongamos que recordar el año 1911 y el nombre Curie es igualmente difícil. La recuperabilidad de la traza de memoria compuesta (es decir, todo el doble cloze) será un producto de la recuperabilidad de sus subtrazas. Esto se debe a la regla general de que las trazas de memoria, en la mayoría de los casos, son en gran medida independientes. Aunque olvidar una traza puede aumentar la probabilidad de olvidar la otra, en la gran mayoría de los casos, como demuestra la experiencia, preguntas separadas y distintas sobre el mismo tema pueden llevar un proceso de aprendizaje completamente independiente, en el que el recuerdo y el olvido son totalmente impredecibles. Veamos cómo tratar las probabilidades de recuerdo como eventos independientes afecta la estabilidad de una traza de memoria compuesta:

(9.1) R=R a*R b

donde:

  • R – recuperabilidad de una traza de memoria compuesta binaria
  • a y R b – recuperabilidad de dos subcomponentes de traza de memoria (subtrazas) independientes: a y b

(9.2) R=exp -kt/Sa*exp -kt/Sb=exp -kt/S

donde:

  • t – tiempo
  • k – ln(10/9)
  • S – estabilidad de la traza de memoria compuesta
  • a y S b – estabilidades de las subtrazas de memoria a y b

(9.3) -kt/S=-kt/S a-kt/S b=-kt(1/S a+1/S b)

(9.4) S=S a*S b/(S a+S b)

Usamos la Ec. (9.4) en el análisis posterior de las trazas de memoria compuestas. Esperábamos que, si inicialmente la estabilidad de las subtrazas de memoria S a y S b diferían sustancialmente, las repeticiones posteriores, optimizadas para maximizar S (es decir, con el criterio R=0.9), pudieran empeorar la estabilidad de los subcomponentes debido al momento subóptimo del repaso. Demostramos que este no era el caso. ¡Las subestabilidades tienden a converger en el proceso de aprendizaje!

La estabilidad de recuerdos complejos puede derivarse de las subestabilidades de recuerdos atómicos

Convergencia de las subestabilidades para trazas de memoria compuestas

Fue fácil simular el comportamiento de los recuerdos complejos en la repetición espaciada. Sus subestabilidades tienden a converger. Esto conduce a un repaso ineficiente y a una lenta acumulación de estabilidad. Hoy podemos demostrar que, a partir de cierto nivel de complejidad, ya no es posible construir estabilidad de memoria para la retención a largo plazo. En resumen, no hay forma de recordar un libro salvo releyéndolo sin parar. Este es un proceso inútil.

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Si generamos un doble cloze, no estamos realmente seguros de si una sola repetición genera una activación uniforme de ambos circuitos de memoria responsables de almacenar las dos piezas distintas de conocimiento. Supongamos que la primera repetición es el único factor diferenciador entre las dos trazas de memoria, y que el resto del proceso de aprendizaje avanza según las fórmulas presentadas anteriormente.

Para investigar el comportamiento de la estabilidad de las subtrazas de memoria bajo un patrón de repaso optimizado para la estabilidad compuesta con el criterio R=0.9, tomemos lo siguiente:

  • a=1
  • b=30
  • S=S a*S b/(S a+S b) (de la Ec. 9.4)
  • SInca-b *e cRd (de la Ec. SInc2005)
  • la traza de memoria compuesta se consolida mediante el repaso con R=0.9, de modo que ambas subtrazas se reconsolidan igualmente bien (es decir, el repaso de la traza compuesta no debe descuidar ninguna subtraza)

Como se puede ver en la siguiente figura, la estabilidad de la memoria para la traza compuesta siempre será menor que la estabilidad de las subtrazas individuales; sin embargo, las estabilidades de las subtrazas convergen.

Figura: Convergencia de la estabilidad de las subtrazas de memoria repasadas con el mismo patrón de repaso optimizado para toda la traza de memoria compuesta (es decir, el repaso ocurre cuando la recuperabilidad compuesta alcanza 0.9). El eje horizontal representa el número de repasos, mientras que el eje vertical muestra el logaritmo de la estabilidad. Las líneas azul y roja corresponden a la estabilidad de dos subtrazas que diferían sustancialmente en estabilidad tras el aprendizaje original. La línea negra corresponde a la estabilidad compuesta (S=S a*S b/(S a+S b)). La disparidad entre S a y S b se autocorrige si cada repaso resulta en una activación uniforme de la estructura sináptica subyacente.

Aumento de la estabilidad compuesta

Advertencia sobre el archivo: ¿Por qué usar archivos literales?

Averigüemos ahora cuánto difiere SInc para la estabilidad compuesta S y para las estabilidades de subtrazas S a y S b. Si suponemos una estimulación idéntica de las subtrazas de memoria, y denotamos SInc a y SInc b como i, entonces, para el número de repetición r, tenemos:

SInc a=SInc bi

a[r]=S a[r-1]* i
b[r]=S b[r-1]* i

S[r]=S a[r]*S b[r]/(S a[r]+S b[r])=
=S a[r-1]*S b[r-1]* i 2/(S a[r-1]* i+S b[r-1]* i)=
i*(S a[r-1]*S b[r-1])/(S a[r-1]+S b[r-1)= i*S[r-1]

En otras palabras:

(11.1) SInc= i=SInc a=SInc b

Lo anterior demuestra que, con el modelo presentado, el aumento de la estabilidad de la memoria es independiente de la complejidad del conocimiento, asumiendo una reconsolidación equitativa de las subtrazas de memoria.

El aumento de la estabilidad compuesta es igual al aumento de la estabilidad de las subtrazas

2014: Algoritmo SM-17

El más reciente algoritmo de SuperMemo puede usarse, en su propio diseño, para resumir su propia filogenia. También puede usarse para escribir la historia contrafactual de la repetición espaciada. Si no hubiera existido los dinosaurios, quizá los humanos no habrían surgido, o serían diferentes. Sin embargo, toda la rama dinosauriana del árbol evolutivo podría eliminarse fácilmente y aun así mantener a los humanos a salvo en su propia rama de mamíferos.

De forma similar, podemos mostrar una cadena aparentemente determinista de acontecimientos vinculados en el surgimiento de la repetición espaciada y del Algoritmo SM-17. Esto puede usarse para demostrar que Biedalak o Murakowski fueron más importantes para la historia de la repetición espaciada que Ebbinghaus. Anki fue más importante que Pimsleur. Gary Wolf tuvo más impacto que William James.

Sin embargo, el máximo impacto de la repetición espaciada aún está por verse, y la confluencia de fuerzas podría reordenar esas primeras influencias. En particular, con una explosión de competencia legítima, el papel central de SuperMemo solo puede conservarse mediante nueva innovación (véase creatividad neural).

Así es como explicaría todo el Algoritmo SM-17 usando los bloques de construcción de la historia tal como se escribió en este artículo:

Y así, paso a paso, el Algoritmo SM-17 ha surgido en la cima del árbol evolutivo de la repetición espaciada.

Adopción exponencial de la repetición espaciada

El lento inicio del Algoritmo SM-2

El Algoritmo SM-2 se usó por primera vez en el aprendizaje el 13 de diciembre de 1987 y, con ligeros ajustes, ha sobrevivido hasta hoy en numerosas aplicaciones. SuperMemo abandonó el algoritmo en 1989; sin embargo, sigue apareciendo en nuevas aplicaciones con una frecuencia que debe rondar varios desarrollos nuevos al mes. Hace tiempo que perdí la cuenta. Algunas de las mutaciones contradicen los principios de SuperMemo y aun así conservan su nombre. Las infracciones más frecuentes incluyen intervalos medidos en minutos, o reducir a la mitad los intervalos al fallar una calificación (al estilo Leitner). Esas mutaciones también dan lugar a algunas noticias falsas sobre SuperMemo. Nótese que las noticias falsas fueron uno de los mayores incentivos para escribir este artículo.

Cuando Duolingo habla en su artículo de parámetros elegidos a mano en referencia a SuperMemo, debe tratarse del resultado de basarse en textos más antiguos, quizá de segunda mano, quizá textos escritos en referencia al Algoritmo SM-2. Al fin y al cabo, SuperMemo ya era bastante adaptable en 1989, y el Algoritmo SM-17 es el ejemplar más adaptable que existe.

Parte de la culpa de esta desinformación es mía, ya que dejé de preocuparme por la revisión por pares y permití que la información circulara libremente por la web sin un esfuerzo suficiente por desmentir mitos.

Las primeras aplicaciones que usaron el Algoritmo SM-2 fueron ramificaciones no comerciales de SuperMemo para Atari en los años ochenta. Más tarde, clones menores de SuperMemo (por ejemplo, para ordenadores de bolsillo) optaron por variantes del Algoritmo SM-2 con sus propias innovaciones, muchas de las cuales dejaron lecciones dolorosas sobre el impacto de irrespetar la memoria en nombre del estudio a última hora.

Para el año 2001, SuperMemo World había avanzado cinco generaciones principales del algoritmo. Todas las líneas de software importantes, incluidas SuperMemo en línea y SuperMemo para Windows, adoptaron las variantes basadas en datos del algoritmo. supermemo.net se convirtió en una de las plataformas pioneras de e-learning (que hoy evoluciona hacia supermemo.com ). SuperMemo para Windows fue pionero en soluciones de autoaprendizaje como la lectura incremental o la creatividad neural. Mientras tanto, el Algoritmo SM-2 se convirtió en la opción fácil de primera elección para otros desarrolladores.

1998: publicación y aceleración

El 10 de mayo de 1998, el Algoritmo SM-2 se abrió al público y se publicó en la web aquí.

Mnemosyne fue la primera en adoptar la herramienta como ramificación de la red neuronal MemAid, creada en 2003. A partir de 2006, Mnemosyne sigue recopilando datos de historial de repetición ejecutando una mutación del Algoritmo SM-2. Como aplicación gratuita multiplataforma, Mnemosyne alcanzó rápidamente una amplia base de usuarios, por ejemplo en Linux, o entre quienes tienen necesidades de Latex.

Anki nació el 6 de octubre de 2006. Se basó en el Algoritmo SM-2 y durante casi una década ofreció el mayor alcance para el algoritmo. Sigue siendo muy popular. Anki introdujo una gran cantidad de innovaciones en su algoritmo, pero se negó a ir más allá de sus principios básicos (véase: crítica a SM3+).

En 2007, cuando conocimos a Gary Wolf, SuperMemo parecía una isla desierta y triste que suscitaba una pregunta: si es tan bueno, ¿por qué otros no intentan copiar el algoritmo? Anki y Mnemosyne eran poco conocidos en esa época. El artículo de Wolf en Wired en 2008 provocó una agradable estampida de desarrolladores de software educativo para implementar alguna forma de repetición espaciada. El Algoritmo SM-2 parecía una fruta al alcance de la mano y su expansión se aceleró. Muchos usuarios de SuperMemo afirman que nunca habrían encontrado el programa sin el artículo de Wolf en Wired. Krzysztof Biedalak suele bromear diciendo que el artículo de Wolf fue efectivamente un punto de inflexión. Sin embargo, no para SuperMemo. Simplemente abrió las compuertas para que la competencia se lanzara al campo de la repetición espaciada.

2008: la explosión

Quizlet se escribió en 2005 y se lanzó en 2007. Al principio era una herramienta típica de estudio a última hora; sin embargo, para 2015, respaldada por capital de riesgo, Quizlet anunció un mayor énfasis en la retención a largo plazo, lo que resultó en la adopción de una variante del Algoritmo SM-2. Para 2017, decidieron usar aprendizaje automático para implementar un nuevo algoritmo que capitalizara los miles de millones de registros de repetición recopilados. El breve paso de SuperMemo por Quizlet debió de dar a una mutación del Algoritmo SM-2 la mayor exposición a usuarios de toda su historia. En su momento, Quizlet informó llegar a uno de cada dos estudiantes de secundaria en EE. UU.

El nuevo enfoque adoptado por Quizlet se basa en fundamentos sólidos y puede dar lugar a una herramienta muy potente; sin embargo, resulta muy decepcionante escuchar la motivación detrás de este cambio hacia mejores algoritmos: » El estudio a última hora es una realidad para muchos estudiantes, y queremos ayudarles a sacar el máximo provecho de su tiempo de estudio, sea cual sea la forma en que lo usen«. El Algoritmo SM-17 ofrece más libertad a los estudiantes: (1) para avanzar en el aprendizaje cuando lo necesiten, o (2) para posponer material de baja prioridad. Sin embargo, siempre desaconsejamos el estudio a última hora como mala práctica. Son las escuelas las que necesitan adaptarse al cerebro humano, no al revés. Esta postura obstinada sobre la eficiencia del aprendizaje perjudica a SuperMemo, pero nunca cambiará.

Ese alejamiento de un simple calendario de repaso por parte de Quizlet en 2017 es probablemente el momento en que el venerable algoritmo antiguo superó su punto máximo de popularidad. Los nuevos competidores tendrán que optar por herramientas inteligentes, o quizá por licenciar el Algoritmo SM-17. La noticia es buena.

¿Cuántas personas usan la repetición espaciada?

A mediados de 1991, uno de mis compañeros de clase intentó animarme. Predijo que tendríamos éxito y lograríamos vender 10-20 copias de SuperMemo. Yo era más optimista. En 1993, predije 1 millón de usuarios para 1996. En 1994, Enter, de Polonia, mencionó un optimismo similar de Marczello Georgiew:

En los cuestionarios recibidos en SuperMemo World, cuando se pregunta a los usuarios de SuperMemo qué es lo que más les gusta del programa, la mayoría abrumadora señala su efectividad. El software puede estar bien, pero lo que realmente cuenta son los resultados en el aprendizaje. ¿Y qué no les gusta? Los usuarios no están satisfechos con esto o aquello, y lo más frecuente es que, incluso en Polonia, SuperMemo siempre se lance primero en inglés. Pero no hay ningún factor de rechazo particular que predomine. Sin duda, nadie cuestiona que con SuperMemo se puede aprender más rápido y nunca preocuparse por olvidar. Teniendo en cuenta este panorama tan optimista, uno podría preguntarse por qué SuperMemo aún no se ha vendido en millones de copias en todo el mundo. Marczello Georgiew, Director de Marketing de SuperMemo World, propuso recordar los problemas que Graham Bell experimentó al intentar introducir su curiosa máquina para hablar por un cable, o lo pesimistas que fueron las predicciones de los futurólogos de la industria sobre la expansión del contaminante caballo mecánico. Luego añade con confianza: A Wozniak le tomó 10 años convertir una necesidad en un invento; dennos la mitad de ese tiempo y convertiremos su invento en una necesidad global.

En mi predicción de 1 millón de usuarios, me equivoqué por 3 años y tuve que hacer una distinción entre usuarios pasajeros y usuarios activos. La proporción de usuarios activos de la repetición espaciada fue disminuyendo a medida que se ampliaba su adopción. En 2007, estimamos que el alcance de SuperMemo era de 5 millones, de los cuales la mayoría eran usuarios de versiones gratuitas y de entregas por fascículos. De esos 5 millones, solo entre el 0,4 % y el 4,0 % eran usuarios activos. Esto pudo haber sido tan solo 20.000 estudiantes.

En 2009, Gwern Branwen estimó que la población de usuarios activos rondaba los 100.000, lo cual parece coincidir con mis cifras. Esto no suena demasiado optimista para dos décadas de arduo trabajo en SuperMemo World.

Veamos entonces más de cerca el alcance actual de la repetición espaciada. Mis estimaciones a continuación se han topado con bastante escepticismo. Estoy de acuerdo en que se basan en muchas conjeturas. Sin embargo, una vez que se está en una curva exponencial de crecimiento, incluso grandes errores de estimación importan poco. Se puede sobreestimar en un 200 % y aun así alcanzar la cifra real rápidamente en poco tiempo.

Por eso no dudo en afirmar que el crecimiento exponencial en la adopción de la repetición espaciada avanza hacia la gran B: mil millones de usuarios. El Kindle de Amazon ha añadido la repetición espaciada a su opción de tarjetas de memoria (Flashcard) en Vocabulary Builder. Incluso los usuarios de SuperMemo que usan Kindle pueden no saber este dato. Las tarjetas de memoria asociadas a libros son la idea general que iba a llevar a SuperMemo a NASDAQ allá por 1996, si hubiéramos logrado convencer al capital de riesgo de que la idea tenía sentido.

Sin embargo, para llegar a mil millones de usuarios necesitamos otro gran avance. El primer candidato obvio que viene a la mente es Facebook, que podría integrar la repetición espaciada en la cacofonía de la interacción social y hacer que el aprendizaje gratuito sea transparente, es decir, donde los usuarios aprendan sin mostrar jamás la intención de hacerlo.

Si piensas que Facebook y la repetición espaciada son mundos incompatibles, piensa en el mundo de la publicidad. Hoy en día todos odiamos la publicidad, sin importar lo bien orientada que esté. Sin embargo, la parte que insiste puede maximizar el efecto de memoria y minimizar la molestia (es decir, la recuperabilidad) empleando la repetición espaciada. Incluso el anuncio de televisión más cautivador nos crispará los nervios a partir de la tercera exposición. El repaso espaciado podría asegurar que la recuperabilidad sea baja y la retención alta.

Por último, pero no menos importante, el repaso espaciado podría ser adoptado por los malos. Los creadores de noticias falsas, y de cosas peores. Un charlatán de la publicidad podría mover los hilos a espaldas de un líder mundial. Podría sacudir el mundo espaciadamente. Esto podría exponer al mundo entero a la repetición espaciada para asegurarse de que todos recordemos.

La cima de la pirámide es tan mala que ni siquiera la voy a enumerar. No quiero darles ideas a los malos.

Mis estimaciones a continuación incluyen un par de puntos bastante seguros. El primer usuario en 1985, el segundo en 1987, un millón para el año 2000, y mi laboriosa estimación de 5 millones en 2007. Hoy, Duolingo afirma tener 200.000 usuarios. Quizlet afirma tener aún más. El crecimiento todavía muestra pocas señales de saturación.

Figura: Esperábamos que la repetición espaciada mostrara señales de saturación hace tiempo. Sin embargo, a través de la transmutación, inevitablemente alcanzará mil millones de usuarios en algún momento. Una vez que se integre con la vida digital humana, afectará a casi todo el mundo. Si mi estimación es correcta, la velocidad de adopción, impulsada por la web, sigue por delante del teléfono, el automóvil y la radio. Nunca pensamos que sería posible competir con los Pokemon o Angry Birds. La fórmula de regresión exponencial en el gráfico es: Alcance=exp((año-1984)*0.63). La línea roja determinada por esa fórmula cruza los mil millones justo ahora

Hoy en día, con casi ninguna barrera de entrada, hay muchos estudiantes que lo prueban y abandonan tras semanas o incluso días de uso. La proporción de usuarios activos puede ser muy baja. Mil millones de usuarios con un aprendizaje insignificante sigue siendo poco aprendizaje. El siguiente paso en esta labor es producir un cambio de paradigma cultural que añada valor al aprendizaje eficiente a largo plazo. Necesitamos comenzar con un cambio en el sistema de escolarización y adoptar los principios del aprendizaje libre.

Una vez que la repetición espaciada alcance mil millones de usuarios, será necesario un cambio de paradigma cultural para convertir la mera adopción en beneficios reales de aprendizaje de calidad a largo plazo

El camino por delante sigue siendo muy largo.

Resumen de la investigación sobre la memoria

El problema de la investigación sobre la repetición espaciada

La historia de la investigación sobre la repetición espaciada se ha visto plagada de los siguientes factores:

  • conjeturas y heurísticas usadas en lugar de la optimización matemática
  • una pobre interacción entre teoría y práctica, con una ciencia centrada en experimentos simples y una práctica centrada en herramientas simples
  • inconsistencia terminológica que lleva a ciclos de olvido y redescubrimiento

Lo anterior coincide con mi clasificación de factores de fracaso. Hasta la llegada de la computación personal y la web, era difícil escapar del círculo vicioso.

Intuiciones sobre la repetición espaciada

Cuando preguntamos a adolescentes una serie de preguntas sobre cómo funciona su memoria, una gran proporción pudo dar suposiciones bastante acertadas sobre el espaciado de las repeticiones sin haber hecho jamás ninguna medición. En particular, a menudo adivinaban correctamente que el primer intervalo óptimo entre repeticiones podría durar entre 1 y 7 días, y que los intervalos sucesivos aumentarían. Además, muchos podían adivinar que el segundo intervalo podría durar un mes y que los intervalos sucesivos podrían duplicarse. En otras palabras, la repetición espaciada es una intuición común.

Los primeros estudios sobre la memoria

En 1885, Hermann Ebbinghaus hizo una contribución importante a la ciencia de la memoria. Experimentó consigo mismo y elaboró el primer esbozo de la curva del olvido. También era consciente del efecto del espaciado. Nunca trabajó en la repetición espaciada. No atribuyo a Hermann ninguna inspiración en mi trabajo sobre repetición espaciada, ya que simplemente no tenía idea de quién era Hermann ni de lo que había logrado. Yo diseñé mi propia medición que condujo a la repetición espaciada. En un ejercicio no relacionado y olvidado, también produje mi propia curva del olvido, que podría haber influido en mi razonamiento. La curva de Hermann era mucho más pronunciada y quizá desalentó cualquier avance posterior (véase: Error de la curva del olvido de Ebbinghaus). La biblioteca de nuestra Universidad Adam Mickiewicz estaba bien surtida de literatura alemana «antigua» de antes de la Segunda Guerra Mundial; sin embargo, yo no sabía alemán. El mío fue un esfuerzo solitario e ignorante. Leí sobre Ebbinghaus más tarde, y mencioné su curva del olvido en mi tesis de maestría.

Para 1901, en los escritos de William James, la superioridad del repaso espaciado parecía clara y parecía cuestión de tiempo antes de que impregnara la teoría del aprendizaje, con la optimización del espaciado como el siguiente paso obvio. No fue así. Durante otras 8 décadas.

En su popular libro de 1932, C.A. Mace sugirió un esquema sencillo de repetición espaciada: 1 día, 2 días, 4 días, 8 días, etc. ¡Buena suposición! Sin embargo, el esfuerzo de Mace cayó en el olvido porque la repetición espaciada «en papel», antes de la era de Internet, difícilmente pudo resultar atractiva. Para un buen comienzo, Mace habría necesitado destacar con un buen ejemplo. Apuesto a que eso no fue fácil. Herr Hitler dominaba las noticias en aquella época.

Los años 60: el Renacimiento

En 1966, Herbert Simon echó un vistazo a la Ley de Jost, derivada hacia 1897 del trabajo de Ebbinghaus. Simon notó que la naturaleza exponencial del olvido requiere la existencia de una propiedad de la memoria que hoy llamamos estabilidad de la memoria. Simon escribió un breve artículo y siguió adelante con los cientos de otros proyectos que lo ocupaban. Su texto quedó en gran medida olvidado.

Casi al mismo tiempo, Robert Bjork tuvo un gran número de ideas innovadoras en relación con el aprendizaje y la memoria. Como suele suceder, se adelantó a su época. Los profesores casi nunca escuchan a los psicólogos. Los estudiantes ni siquiera conocen sus nombres. Si Bjork hubiera sido programador, podríamos haber tenido la primera aplicación popular de repetición espaciada una década antes. Creo que él no habría dejado escapar una gran idea. Parece que fue Bjork quien primero separó claramente la fuerza de recuperación y la fuerza de almacenamiento, en un modelo análogo a nuestro modelo de dos componentes de la memoria.

En 1967, Paul Pimsleur pudo ver claramente que la repetición espaciada podría ser una gran herramienta para aprender pares de palabras en el aprendizaje de idiomas. Al igual que SuperMemo, luchó con la terminología y usó el término «recuerdo de intervalo graduado». En nuestro reto de la «curva de olvido dentada», Pimsleur estuvo más cerca, con el gráfico de curvas dentadas más antiguo conocido, como se ve en la imagen:

Quizá descubramos bocetos anteriores de la idea; sin embargo, por razones técnicas, cuanto más antigua es la impresión, menos rica es en gráficos, que hoy generamos en masa en Excel.

Los intervalos de Pimsleur se extendían a períodos de horas, minutos e incluso segundos. Era el reflejo de una intuición, no de una medición. Extendió su razonamiento desde el conocimiento declarativo, fácil de medir (por ejemplo, pares de palabras), hasta el conocimiento procedimental y el reconocimiento de patrones sonoros, como en el aprendizaje de la pronunciación. SuperMemo resuelve este problema separando el aprendizaje de pares de palabras de la pronunciación, la ortografía, el reconocimiento, los sinónimos, etc. Como resultado, por ejemplo en Advanced English, nunca necesitamos reducir los intervalos más allá de la estabilidad inicial estándar del usuario, que rara vez baja de un día. Por razones prácticas y debido al papel del sueño, SuperMemo nunca usa intervalos más cortos que 1 día. El sueño también es la razón principal por la que el algoritmo usa una resolución de 1 día en la duración de los intervalos. SuperMemo permite repasar varias veces en un día, pero esto forma parte de un repaso de subconjunto que, en ocasiones, puede resultar útil (por ejemplo, al estudiar a última hora para un examen). Las recomendaciones de intervalo de Pimsleur eran diferentes de las de Mace o de SuperMemo en papel ( Algoritmo SM-0). No eran resultado de una medición, sino de una especulación, que oscilaba entre sólida y pobre. Pimsleur pensaba en asegurar un recuerdo del 60 %, lo cual es muy bajo según los estándares de SuperMemo. Apostó por una estabilidad inicial de 5 segundos, mientras que SuperMemo usa entre 1 y 15 días, lo cual es perfectamente adecuado para un 90 % de recuerdo de conocimiento bien formulado. La base de la exponenciación de intervalos de Pimsleur (el Factor-E) era 5, cuando en la mayoría de los casos debería ser 1,4-2,5. Como resultado, el espaciado de Pimsleur difiere drásticamente del de SuperMemo, y no debería usarse como referencia en una métrica algorítmica. En su artículo original (1967), Pimsleur propuso intervalos de 5 seg., 25 seg., 2 min., 10 min., 1 hora, 5 horas, 1 día, 5 días, 25 días, 4 meses y 2 años. Las diferencias provenían sobre todo de la práctica basada en materiales de distinto carácter (equivalente a una alta complejidad en SuperMemo). El uso de segundos, minutos y horas equivale a estudiar a última hora y se desaconseja enérgicamente en SuperMemo. En su lugar, se recomienda optimizar la representación del conocimiento.

En 1969, Alfred Maksymowicz escribió «Lee y piensa». No encontrarás su libro en tu biblioteca. Fue escrito en polaco y para un círculo reducido de estudiantes de universidades técnicas. Mencionaba la repetición espaciada, las curvas del olvido, e incluso cómo el índice de olvido podría determinar el intervalo óptimo. Maksymowicz propuso que el primer intervalo óptimo fuera de 3 días. Como muchos esfuerzos anteriores y posteriores, este buen consejo permaneció en gran medida ignorado. Los estudiantes se apresuran a aprobar un examen y luego olvidan. El estudiar y desechar es un principio por el cual la presión de la escolarización destruye las perspectivas de un buen aprendizaje a largo plazo. Conozco el libro de Maksymowicz solo porque estudié en una universidad técnica en Polonia, y solía hablar en voz alta de mi propio método de repetición espaciada. Solo puedo imaginar que ha habido docenas de textos similares donde las intuiciones se formularon como buenos consejos que luego fueron ignorados por las masas. Sin la coincidencia de tiempo y lugar, los textos futuros sobre repetición espaciada quizá nunca hubieran notado que Maksymowicz existió. Maksymowicz pudo haberse inspirado en Pimsleur, Mace, su propia intuición, u otros textos potenciales de los que no tengo conocimiento. Maksymowicz da crédito a las palabras de Szafraniec, escéptico respecto a SuperMemo«todo ha ocurrido antes».

1972: la caja de Leitner

El mayor éxito práctico y algorítmico en el campo del repaso espaciado antes de SuperMemo puede atribuirse a Sebastian Leitner. En 1972, propuso el sistema de la caja de Leitner . En un sistema de Leitner, las tarjetas de memoria se priorizan y se depositan en cajas correspondientes a distintos niveles de estabilidad. El sistema de Leitner tiene una enorme ventaja sobre los consejos teóricos dados antes de su propuesta: era práctico. Era un sistema que cualquiera podía usar con una introducción mínima. Incluso SuperMemo en papel ( 1985) parece complejo en comparación.

Figura: Una mutación incorrecta del sistema de Leitner en la que las respuestas fallidas se mueven hacia atrás solo una caja (fuente: Wikipedia). Esta variante se usó en Duolingo durante un tiempo

La caja de Leitner no es una herramienta de repetición espaciada. Es una herramienta de priorización. No existe el concepto de un intervalo, y mucho menos de un intervalo óptimo. El nombre caja proviene de la implementación original en forma de cajas físicas de tarjetas de memoria, sin ninguna asociación con el paso del tiempo. Cuando la caja de Leitner se usa regularmente en una colección pequeña de tarjetas de memoria, simula el comportamiento de la repetición espaciada. Si los intervalos son demasiado cortos, conduce al estudio a última hora. Si se vuelven demasiado largos, conduce a resultados subóptimos. Sin embargo, en SuperMemo, el material de baja prioridad también puede posponerse cíclicamente y producir intervalos muy largos, que reducen el aumento de estabilidad esperado, pero conllevan un aumento de estabilidad mayor para los ítems que sobreviven a intervalos más largos. En los años 90 y a principios del nuevo milenio, el sistema de Leitner se usó en muchas aplicaciones exitosas de tarjetas de memoria. A medida que fueron ajustando y mejorando los procedimientos de repaso, estas aplicaciones podrían haber evolucionado en un sistema de repetición espaciada en toda regla. Sin embargo, su uso declinó debido a la popularidad del Algoritmo SM-2 de SuperMemo, que resultó ser fácil de implementar y ampliamente superior.

Las mutaciones más nuevas del sistema de la caja de Leitner pueden asignar intervalos a las cajas de prioridad, por ejemplo, 16 días para la Caja n.º 5, pero este enfoque tiene fallos equivalentes al estudio a última hora: (1) el fallo sigue provocando la regresión de los intervalos, cuando debería llevar a reanudar el aprendizaje, (2) cinco repeticiones en el primer mes no se comparan bien con un conocimiento bien formulado, que puede reducir el costo de aprendizaje en SuperMemo solo en el primer mes en un 60-80 %, y (3) se necesitarían más cajas. Hemos visto intervalos muy superiores a la máxima esperanza de vida humana en SuperMemo. Las necesidades de las aplicaciones de por vida son un 200 mil por ciento más altas. Esta es la diferencia entre un intervalo permastore y 16 días. Se necesitarían 11 cajas adicionales para cubrir toda una vida con un Factor-E de 2.

Hoy, uno de los sistemas más populares para aprender idiomas es Duolingo. Durante mucho tiempo, usó el sistema de Leitner. Hoy emplean su propio algoritmo nuevo basado en predicciones de recuperabilidad. Sin embargo, siguieron usando el sistema de Leitner como referencia. Para empeorar las cosas, su referencia usaba la transferencia inversa de tarjetas de memoria entre cajas de prioridad (donde la estabilidad posterior a un fallo se sobreestima). El Leitner normalizado podría usarse como referencia; sin embargo, una normalización simple, equivalente a usar un Factor-E de 2, puede producir resultados distintos que la elección de un Factor-E de 1,6. En el futuro, todos los algoritmos deberían adoptar una métrica universal propuesta por SuperMemo, y el Algoritmo SM-2 podría convertirse en una métrica de referencia útil que pueda implementarse en paralelo con soluciones propietarias. Espero que los usuarios exijan claridad, estadísticas, métricas y plena transparencia al respecto.

En los años 70, Tony Buzan se centró en el conocimiento estructurado con sus innovaciones de mapas mentales. Los mapas mentales y SuperMemo estarían, paradójicamente, en conflicto por la falta de una buena teoría unificadora. En resumen, necesitamos buenos modelos para entender el mundo, y necesitamos el repaso espaciado para retener los componentes del modelo a largo plazo. Buzan también tenía sus propias ideas sobre cómo debía espaciarse el repaso. Cuando conoció SuperMemo a principios de los años 90, estuvo de acuerdo con el concepto de inmediato; sin embargo, siempre prefirió centrarse en la estructura del conocimiento más que en el mero repaso.

Años 80: SuperMemo

Mi propio trabajo entró en escena en 1982, cuando me harté de verdad de un proceso interminable de olvido. Quería aprender bioquímica y fisiología. Leía libros, tomaba notas, y todo era en vano debido al proceso de olvido. Incluso los datos más importantes podían escapárseme de la memoria en el momento más inoportuno (por ejemplo, un examen). Decidí emplear el recuerdo activo. En lugar de simplemente tomar notas, las redactaba en forma de preguntas y respuestas. Podía tapar las respuestas y responder usando el recuerdo activo. Esto mejoraba enormemente el aprendizaje. Así es como se hace en SuperMemo hasta el día de hoy. Este nuevo enfoque tuvo un impacto encantador en el fortalecimiento de mi amor por el aprendizaje.

Para 1984, ya dominaba lo suficiente mi enfoque de recuerdo activo como para saber que las preguntas complejas no funcionan. Si metes demasiado contenido en la respuesta, por ejemplo, haciendo una lista larga, seguirás olvidando. Sería un aprendizaje inútil. Más tarde llamé a esa búsqueda de simplicidad el principio de información mínima. Hoy, este principio es uno de los primeros mencionados entre las 20 reglas de la formulación del conocimiento.

El verdadero avance llegó en 1985, es decir, exactamente 100 años después de la publicación de la disertación de Ebbinghaus sobre la memoria. Quería comprobar cómo el espaciado del repaso afecta al recuerdo. Necesitaba averiguar la duración de los intervalos óptimos entre repeticiones. Obviamente, esos intervalos existen. Solo tenía que medirlos. El experimento se describe aquí. El experimento fue simple, tosco, perezoso y apresurado. En lugar de tomarme unos años pacientes para averiguar todos los detalles, tras 6 meses formulé el primer algoritmo de SuperMemo. Se le puede llamar el primer caso de repetición espaciada algo científica. Mi investigación se basó en una sola persona y un solo tipo de material de aprendizaje, pero fue lo bastante universal como para tener muchos usuarios fieles años después. El 31 de julio de 1985, comencé a aprender bioquímica con el nuevo método. Este es el cumpleaños de la repetición espaciada computacional. El programa informático SuperMemo para DOS llegó en 1987, y el nombre SuperMemo en 1988.

En los años 80, el Modelo de Cadena de Memoria de Jaap Murre fue uno de los primeros modelos de memoria que podría haber conducido a un sólido algoritmo de repetición espaciada. Incluso tuvo su propia aplicación temprana, Captain Mnemo, que podría haber competido con SuperMemo por la prioridad en el campo. Captain Mnemo y OptLearn son ejemplos de por qué, en entornos académicos, las grandes teorías a menudo no van acompañadas de implementaciones prácticas que puedan ganar mayor aceptación.

En 1991, se formó SuperMemo World y sus inicios se describen aquí. Para 1999, comenzamos a usar el término «repetición espaciada» en lugar del «método SuperMemo». Para conocer los desarrollos recientes en SuperMemo World, véase aquí.

La anatomía del fracaso y del éxito

Fórmula para el fracaso de la investigación

Algunas intuiciones sobre la repetición espaciada son bastante comunes. Esto plantea una gran pregunta: ¿por qué no se investigó antes la repetición espaciada, y por qué no permeó en la práctica del aprendizaje? Las intuiciones no bastan; también es vital un buen diseño experimental. Esta sección explica por qué otros estuvieron cerca pero fracasaron. Cómo Ebbinghaus o Spitzer podrían haber dado vida a la repetición espaciada entre 90 y 130 años antes. Debe haber algo erróneo en la inmediatez de la gratificación en la revisión por pares y la lucha por becas. ¿Por qué hay tanto revuelo en torno a medicar a los niños para la escuela, mientras que las enfermedades que causan un pesado tributo de muertes en países menos desarrollados generan poco interés?

En este capítulo, intento averiguar por qué la repetición espaciada tardó tanto en llegar. Aquí está mi opinión, priorizada por factor de impacto:

  • los ordenadores marcan una diferencia dramática en la eficiencia del aprendizaje en la repetición espaciada; las primeras formulaciones no habrían sido lo bastante virales ni siquiera en la era de Internet
  • la web perpetúa el conocimiento y cristaliza su esencia (por ejemplo, en Wikipedia)
  • las intuiciones no garantizan un buen diseño experimental. Yo mismo, Ebbinghaus, Spitzer y otros produjimos diseños que añadían más ruido y complejidad al asunto
  • la cultura humana está en un flujo perpetuo. Olvidamos masivamente y redescubrimos hallazgos antiguos. Esto es tan cierto para los individuos como para las culturas. La ciencia también está sujeta a modas, tendencias y olvido. Solo ahora la repetición espaciada ha alcanzado la «densidad de impacto» necesaria para convertirse en «conocimiento común». Véase: Discontinuidad en la investigación sobre el efecto del espaciado
  • el interés propio y el autoaprendizaje son los mejores motores de aplicabilidad. La ciencia permea las vidas a través de aplicaciones prácticas. SuperMemo fue la primera aplicación práctica de la repetición espaciada que pudo alcanzar miles y luego millones de usuarios
  • solía haber una gran confusión entre memoria a corto y largo plazo, entre el espaciado en listas y el espaciado en un mismo día, e incluso entre el aprendizaje procedimental y el declarativo
  • un calendario de repaso expansivo, contractivo o equiespaciado pueden volverse todos superiores con el momento adecuado
  • los experimentadores tienden a usar material heterogéneo (poemas, listas, sílabas sin sentido, páginas de preguntas, grupos de estudiantes, etc.)
  • los experimentos en los que se usa repaso pasivo en lugar de recuerdo activo no se benefician del efecto de la evaluación
  • los experimentos en los que los intervalos se miden en ítems intermedios se basan en mecanismos de memoria diferentes y ni siquiera deberían etiquetarse como repetición espaciada. Hasta el día de hoy, gran parte de la confusión en la investigación se debe a mezclar las medidas de los intervalos sin una separación clara de la terminología
  • la corta duración de los proyectos de investigación hace que las investigaciones sobre repetición espaciada resulten muy difíciles
  • el enfoque en aplicaciones de aula ha confundido los resultados. Las escuelas no son un buen lugar para aprender. La investigación que se optimiza para el entorno escolar tiene poca relevancia en el aprendizaje libre
  • la antigua distinción entre aprendizaje y retención confunde el pensamiento sobre la educación óptima. Esta distinción proviene de la escolarización, en la que aprendemos primero y luego rezamos para olvidar poco
  • la terminología sigue mutando y esto dificulta que las nuevas generaciones de investigadores capitalicen el trabajo previo. Incluso nuestro propio artículo de 1994 usa el término espaciado de repetición. Para la lista de mutaciones terminológicas, véase esta entrada del glosario. La web, la sabiduría de las masas y los wikis (como este) probablemente remedien el problema de la terminología

En 2006, Will Thalheimer elaboró una excelente revisión de investigación sobre la repetición espaciada, basada en más de 100 artículos de investigación. Sin embargo, en el resumen, Thalheimer expresó dudas sobre el valor del espaciado progresivo. Esto demuestra que incluso decenas de artículos no ayudan si el diseño experimental se basa en modelos incorrectos.

En la repetición espaciada, no basta con que el repaso sea expansivo. El repaso necesita ser óptimamente expansivo

Experimentación fallida

Enumeraré tres casos de experimentos condenados a fracasar o a generar confusión:

  • Herman Ebbinghaus (1885) estaba motivado por la ciencia de la memoria. Sus intuiciones eran excelentes; sin embargo, en nombre de la pureza, se centró en sílabas sin sentido. Sin querer, contribuyó a la complejidad de la memoria y a la interferencia, precisamente lo que buscaba evitar. Su curva del olvido es despiadada y desalentadora. Si Ebbinghaus hubiera aprendido material significativo y de interés, quizá habría ampliado el alcance de su experimento. Todos sabemos por la escuela que estudiar sin sentido a última hora es una forma de tortura mental. Si Ebbinghaus hubiera optado por aplicaciones prácticas, como hice yo, quizá habríamos tenido una variante en papel de la repetición espaciada nacida justo 100 años antes de que ocurriera. Naturalmente, sin ordenadores, sin la web, sus ideas podrían haber caído igualmente en el pozo del silencio durante un siglo, tal como de hecho le sucedió al concepto del efecto del espaciado.
  • Herbert Spitzer (1939) estaba motivado por mejorar el rendimiento en el aula. Optó por el peor caso de heterogeneidad. Mientras yo luchaba con páginas de material de dificultad mixta, y Ebbinghaus luchaba con material sin sentido, Spitzer agravó esos efectos con la heterogeneidad de las mentes. En lugar de páginas de preguntas, Spitzer tenía grupos de alumnos expuestos a páginas de material de lectura. En esas condiciones ruidosas, resulta difícil ver las regularidades del olvido exponencial y la repetición espaciada. Incluso si los resultados de Spitzer hubieran sido abrumadoramente positivos, dudo que la burocracia del sistema educativo hubiera hecho buen uso del procedimiento. La educación está impulsada por pruebas estandarizadas, calificaciones y certificados. Casi nunca está impulsada por la ciencia ni por el impacto real del procedimiento de aprendizaje en los resultados del aprendizaje. Es un sistema de fábrica. Los esfuerzos de Spitzer estaban tan condenados como aquellas ideas revolucionarias de Benezet surgidas una década antes (1929)
  • Wozniak (1985). Mi propio experimento engañoso sobre la repetición espaciada comenzó el 31 de enero de 1985 y podría haber arruinado mis esfuerzos si hubiera confundido lo suficiente mi razonamiento. Por suerte, antes de que llegaran los resultados, diseñé un experimento mejor y nunca me vi afectado por la confusión.

Experimentos de Ebbinghaus (1885)

El mito

Un mito popular dice que Ebbinghaus inventó la repetición espaciada allá por 1885. Ese mito nació de nuestra propia documentación de SuperMemo. Cuando compilamos la historia de SuperMemo para la web en 1997, añadimos algunos nombres con contribuciones a la investigación de la memoria. Como se explica aquí, era importante mantener a SuperMemo anclado en la ciencia. Mi propia contribución siempre se ha minimizado debido al peso insignificante de mi nombre. Como Ebbinghaus encabezaba la lista por razones cronológicas, pronto dio pie a la idea de que era el padre de la repetición espaciada. Incluso nuestros propios materiales evolucionaron en esa dirección por error, debido a una edición descuidada. Hoy, la web está inundada de Ebbinghaus y del conjunto dentado de curvas del olvido. Si buscas en Google las curvas del olvido, verás esto:

Figura: Búsqueda en Google de » curva del olvido» (noviembre de 2017). El «conjunto dentado» de curvas del olvido domina la búsqueda. Muchas de las imágenes están etiquetadas con una atribución errónea al nombre de Hermann Ebbinghaus. El origen más adecuado de la imagen se presenta en Dos componentes de la memoria

Estas son las mismas curvas dentadas que representé en Optimización del aprendizaje (1990):

Mecanismo hipotético implicado en el proceso de aprendizaje óptimo

Para más información sobre el mito, véase nuestro blog: ¿Inventó Ebbinghaus la repetición espaciada?

El hecho

Deberíamos más bien asombrarnos del hecho de que Ebbinghaus no llegara a la repetición espaciada. Estuvo muy cerca. Estaba tocando todos los botones correctos.

Esto es lo que escribió sobre el efecto del espaciado:

Para el reaprendizaje de una serie de 12 sílabas en un momento definido, en consecuencia, 38 repeticiones, distribuidas de cierta manera a lo largo de los tres días anteriores, tuvieron un efecto tan favorable como 68 repeticiones hechas el día inmediatamente anterior. Incluso si se hacen grandes concesiones a la incertidumbre de las cifras basadas en tan pocas investigaciones, la diferencia es lo bastante grande como para ser significativa. Esto hace probable la suposición de que, con cualquier número considerable de repeticiones, una distribución adecuada de estas a lo largo de un espacio de tiempo es decididamente más ventajosa que concentrarlas en un solo momento.

¿Por qué no dio Ebbinghaus el siguiente paso, aparentemente obvio, de ver cómo cambia la curva del olvido tras el repaso? Para empezar, no estudió el olvido, sino el ahorro en el reaprendizaje. Sus pruebas eran un repaso. Con mi enfoque, es fácil querer alcanzar un nivel fijo de retención. Es conceptualmente menos intuitivo pedir una reducción fija en el costo del reaprendizaje.

Sin embargo, una solución para superar ese obstáculo conceptual sería persistir en el aprendizaje. La creatividad prospera con la inversión de tiempo y pensamiento en contextos variados. Para mí, la respuesta al enigma de Ebbinghaus es muy sencilla. Como buen científico, Ebbinghaus era un perfeccionista teórico. Eligió memorizar sílabas sin sentido para minimizar la interferencia de sus conocimientos previos. Desafortunadamente, esto tuvo algunos efectos secundarios negativos:

  • sus listas eran difíciles de aprender y su curva del olvido era muy pronunciada. Esto ofrece una imagen muy desalentadora para cualquier estudiante que se preocupe por recordar a largo plazo
  • sus listas no le proporcionaban ningún placer de aprender. Esto es exactamente lo contrario de lo que experimenté yo en 1985. Cada ítem de mi colección en papel era un pequeño paso adelante en el avance de mi conocimiento hacia un nuevo nivel. En cuanto tracé mi primera curva del olvido, quise saber qué pasaba después del siguiente repaso
  • Ebbinghaus se centró en el tiempo o esfuerzo necesarios para el reaprendizaje, mientras que a mí siempre me interesó sobre todo la retención, con poco interés en cuánto tiempo o esfuerzo se necesita para devolver el recuerdo al 100 %

Me atreveré entonces a afirmar que, en todos sus heroicos esfuerzos de memorización, Hermann Ebbinghaus se hartó de aprender sinsentidos. Esto habría desanimado al estudiante más persistente. Mi mejor suerte vino de la necesidad ardiente de obtener buenos resultados en el aprendizaje. Esto dio lugar a la autoperpetuación del esfuerzo. Esto ayuda a superar los obstáculos creativos.

Curiosamente, en 2015, Jaap Murre reprodujo el experimento original de Ebbinghaus con una meticulosidad digna del propio Ebbinghaus (incluso hurgando en los manuscritos originales). Murre fue lo bastante prudente como para no someterse él mismo a la tensión mental de las sílabas sin sentido, lo cual podría haber introducido cierto sesgo. Tomó al mejor sujeto disponible: un estudiante de 22 años a quien recompensó con la coautoría de la publicación. Curiosamente, Murre parece haber logrado captar el efecto circadiano del aprendizaje, ya que su curva muestra un pequeño repunte tras el periodo de 24 horas.

El ahorro en el reaprendizaje

Existe una gran diferencia entre la recuperabilidad y el «ahorro en el reaprendizaje». Según el momento, la falta de recuperación puede significar que el dato «acaba de olvidarse y se reaprende fácilmente» o que se ha «olvidado para siempre». El ahorro en el reaprendizaje puede ser distinto de cero en materiales con recuperabilidad cero. En términos simples, la falta de acceso a los recuerdos no implica una estabilidad cero. En ese sentido, la curva de Ebbinghaus ni siquiera es una buena expresión del olvido exponencial. Habrá un ahorro en el reaprendizaje distinto para material difícil y para material fácil.

Curva del olvido (1984)

Mientras escribía el capítulo sobre curvas del olvido, pensé que mi propia noción de la curva del olvido había sido errónea al principio. Sin embargo, al hurgar en mis archivos, descubrí por accidente que también había trazado una curva del olvido para la retención de vocabulario en inglés en 1984, apenas unos meses antes de diseñar SuperMemo en papel:

Figura: Mi primerísima curva del olvido para la retención de vocabulario en inglés, trazada allá por 1984, es decir, unos meses antes de diseñar SuperMemo en papel. Este gráfico no formaba parte de un experimento. Era simplemente una evaluación acumulativa de los resultados del aprendizaje intermitente de vocabulario en inglés. El gráfico se olvidó pronto. Se redescubrió 34 años después. Tras la memorización, se repasaron 49 páginas de ~40 pares de palabras en inglés a distintos intervalos, y se registró el número de errores de recuerdo. Tras descartar valores atípicos y promediar, la curva resulta ser mucho menos pronunciada que la obtenida por Ebbinghaus (1885), quien usó sílabas sin sentido y una medida distinta del olvido: el ahorro en el reaprendizaje

Olvidé el hecho de haber trazado esa curva. Supongo que, una vez que tuve SuperMemo, esa curva ya no me parecía importante o relevante. No estaba centrado en la «ciencia de la memoria». Solo quería obtener buenos resultados en el aprendizaje. Al parecer, no pensé que trazar una curva del olvido fuera gran cosa. Casi pasé por alto esa figura en 2018 también, ya que estaba etiquetada en letra pequeña como: velocidad media de olvido en la primera memorización.

El resultado provino de 49 páginas de 40 pares de palabras cada una, es decir, 1960 palabras (compárese con: 13 años de escuela en un mes). Realicé todo mi aprendizaje por el mero gusto de aprender, no para el experimento. En realidad, no hubo ningún experimento como tal. Solo necesitaba recopilar las cifras de mi propio esfuerzo de aprendizaje real y trazar la curva. La simplicidad del cálculo también podría explicar por qué olvidé el ejercicio con tanta facilidad.

Ya escribí sobre las intuiciones sencillas anteriores al experimento de 1985. A la luz de esta curva de 1984, podría parecer que las intuiciones se derivaron de aquel pequeño experimento. Lo que hoy parece obvio quizá no lo era tanto sin la muleta de aquel pequeño cálculo. Sin embargo, puedo suponer que para febrero de 1985 ya había olvidado mi curva, porque no me salté la Etapa A en el experimento de repetición espaciada. Mi curva del olvido coincidía con el experimento, y el primer intervalo de repaso debía ser, en efecto, de 1 día.

La noción errónea de las curvas sigmoidales debió de nacer más tarde. Hoy me parece recordar vagamente que en un principio pensaba que la naturaleza sigmoidal solo entraba en juego después del primer repaso. Es posible que nunca sepa cómo funcionaba mi proceso de pensamiento en aquel momento. Todo lo que me importaba era la eficiencia de SuperMemo. En la emoción del descubrimiento de SuperMemo, olvidé mi curva durante 34 años enteros. Hoy, ese pequeño gráfico solo importa para ilustrar con qué facilidad podemos descubrir, olvidar, extraviarnos, redescubrir y luego volver a redescubrir el descubrimiento original. La memoria es falible. Dios bendiga la repetición espaciada.

Figura: La primerísima curva del olvido para la retención de vocabulario en inglés, trazada allá por 1984 (unos meses antes de diseñar SuperMemo en papel). Este gráfico no formaba parte de un experimento. Era simplemente una evaluación acumulativa de los resultados del aprendizaje intermitente de vocabulario en inglés. El gráfico se olvidó y se redescubrió 34 años después. Tras la memorización, se repasaron 49 páginas de ~40 pares de palabras en inglés a distintos intervalos, y se registró el número de errores de recuerdo. Los círculos blancos corresponden al recuerdo derivado del número promedio de errores por página tras un intervalo dado. La regresión logarítmica en naranja ofrece el mejor ajuste. La regresión de potencia en rojo la sigue de cerca. Esto podría esperarse de material heterogéneo (páginas de palabras). Esto también es muy similar a los resultados obtenidos por Ebbinghaus (1885), salvo que la curva es mucho menos pronunciada, como corresponde a material significativo. Como era de esperar, la regresión exponencial en blanco ofrece el ajuste más débil

Experimento de Spitzer (1939)

En 1939, Herbert F. Spitzer investigó varios calendarios de evaluación en 3605 alumnos de sexto grado de 9 ciudades de Iowa. Se trataba de toda la población de 91 escuelas. Los niños leyeron un texto de 6 páginas y su conocimiento se evaluó después con 25 preguntas específicas.

Spitzer diseñó distintos calendarios de evaluación; sin embargo, el diseño claramente no apuntaba al espaciado óptimo, y el resumen de su investigación no hizo ninguna recomendación al respecto.

Figura: Diagrama del procedimiento. Spitzer (1939).

Solo los dos primeros grupos de estudiantes usaron un calendario expansivo. Estos fueron los grupos que obtuvieron los mejores resultados en las pruebas; sin embargo, Spitzer lo atribuyó al efecto de la evaluación, ya que estos eran los únicos dos grupos con 3 pruebas, es decir, la prueba intermedia se interpretó como una «intervención de evaluación» (en lugar de repetición).

Figura Spitzer (1939). Curvas de retención

En sus recomendaciones, Spitzer se centró en el poder del efecto de la evaluación, lo que yo llamo «recuerdo activo» en referencia a mis tarjetas de memoria de 1982. Lo que me gusta de su artículo es la recomendación de que la evaluación se use para que los estudiantes corrijan su propio conocimiento, reciban retroalimentación y así tengan una sensación de su progreso. Esto contrasta con las evaluaciones modernas, que a menudo se usan más como un látigo para obligar a los niños a estudiar más.

El diagrama de intervalos de Spitzer me recuerda a mi propia prueba autoadministrada, que no logró producir resultados convincentes. En este caso, los intervalos claramente están marcados por la vida escolar, no por las exigencias de la memoria.

En su investigación, Spitzer mostró un enfoque despiadadamente gatesiano hacia la evaluación y el aprendizaje, típico de los primeros innovadores escolares que a menudo causaban más daño que bien por ser demasiado meticulosos. Los educadores que no emplean el impulso de aprender en el proceso están condenados a fracasar, ¡incluso si emplean las mejores herramientas para potenciar la memoria!

No puedo dejar de señalar la cuestión de las consideraciones éticas. Mientras sacrificamos millones de animales en nombre de la ciencia, quizá no notemos que esta investigación, con toda la buena intención del mundo, usó la mano de obra de más de 3000 participantes involuntarios. Lo que es estupendo para la investigación de la memoria no tiene por qué serlo para el aprendizaje individual. En la era de Google, encontré los textos de prueba usados por Spitzer bastante desagradables. A pesar de que se puso un gran esfuerzo en la selección del tema y la redacción, consideraría la lectura coercitiva una violación de mi libertad. Esos materiales pueden ser mucho mejores que el promedio de tu escuela, pero la escolarización siempre tratará más de la producción en masa que de la libertad creativa.

Leer sobre la biología de las plantas de banano podría resultar agradable para un jardinero o un biólogo, que es lo que afirmo ser. Sin embargo, ¿por qué necesitarían los niños leer sobre bananos si su interés actual era la Gran Depresión, el Dust Bowl, la Alemania nazi o el béisbol?

La escuela es el momento en que dejamos de aprender y empezamos a estudiar a última hora. Es el momento en que perdemos el amor por aprender. Añadir la repetición espaciada a esta mezcla coercitiva solo podría empeorar las cosas.

Experimento de Wozniak (1985)

Antes de que lograra calcular los intervalos óptimos para repasar páginas de vocabulario en inglés, diseñé un experimento que podría haberme puesto en el camino equivocado. El experimento pretendía demostrar el valor del aumento progresivo de los intervalos de repaso. En cambio, mostró que un repaso equiespaciado podría ser superior.

Los experimentos científicos no deberían considerarse «fallidos» solo porque arrojen resultados inesperados. Sin embargo, en este caso, los resultados inesperados provinieron de un mal diseño y podrían haber generado confusión que inhibiera el progreso posterior. Hasta hoy, los investigadores hablan de «resultados mixtos» en la repetición espaciada debido a un diseño incorrecto o incluso a una simple confusión terminológica.

Afortunadamente, mis intuiciones sobre la memoria en 1985 eran lo bastante sólidas, y era bastante obvio que, con una rápida aceleración en la duración creciente de los intervalos, el olvido podría desbordar la consolidación. Mi calendario progresivo simplemente no era óptimo. Sin duda habría diseñado un mejor seguimiento. Sobre todo, quería seguir aprendiendo con éxito. Dudo que me hubiera rendido sin encontrar una buena solución.

El experimento demuestra que no basta con tener una buena suposición sobre cuáles son los intervalos óptimos. Los intervalos realmente necesitan calcularse.

Advertencia de archivo: ¿Por qué usar archivos literales?

Este texto forma parte de: » Optimización del aprendizaje » de Piotr Wozniak (1990)

A principios de 1985, diseñé dos experimentos que en consecuencia revolucionaron mi metodología de aprendizaje y llevaron a la formulación del método SuperMemo.

El primer experimento puede ser una buena ilustración de cómo una idea mal concebida puede arrojar conclusiones valiosas (el segundo se describe aquí). Es una intuición común que, con repeticiones sucesivas, el conocimiento debería volverse gradualmente más duradero y requerir un repaso menos frecuente. Por lo tanto, las repeticiones separadas por intervalos crecientes deberían ser más efectivas que aquellas cuyos intervalos son siempre iguales. Esta creencia resultó falsa. Veamos un experimento que demuestra el hecho:

Experimento sobre la influencia de diversos patrones de espaciado de repetición en el efecto de las repeticiones sobre la retención del conocimiento (31 de enero de 1985 – 2 de agosto de 1986)

  1. El conocimiento memorizado consistía en 195 ítems divididos en tres grupos iguales: A, B y C.
  2. Cada uno de los ítems tenía la siguiente forma: Pregunta: verbo irregular en inglés Respuesta: formas de presente simple, pasado simple y participio pasado del verbo en cuestión
  3. Todos los ítems de un grupo determinado se memorizaron en una sola sesión repitiéndolos hasta que todos se supieran (grupo A – 31 de enero, B – 2 de febrero, C – 3 de febrero).
  4. Se establecieron dos fechas de control finales: 6-7 de diciembre de 1985 y 1-2 de agosto de 1986, en las que se midió el nivel de retención en todos los grupos al mismo tiempo (para cada ítem se midió la precisión del recuerdo en una escala de cuatro grados).
  5. Antes de las fechas de control, todos los grupos A, B y C pasaron por 6 repeticiones independientes en los siguientes intervalos (expresados en días):
Número de repeticiónGrupo A
(espaciado equitativo a lo largo de un periodo más largo)
Grupo B
(espaciado basado en intervalos crecientes)
Grupo C
(espaciado equitativo en 30 días)
118 días1 día5 días
218 días5 días5 días
318 días9 días5 días
418 días24 días5 días
518 días44 días5 días
618 días70 días5 días

La intención del experimento era demostrar que los intervalos crecientes son los mejores para la consolidación de la memoria (grupo B), frente a intervalos distribuidos de forma equitativa (grupo A) o concentrados en el tiempo (grupo C). Los resultados del experimento se muestran en la Fig. 3.1:

Los resultados del segundo control no se muestran en el gráfico por el hecho prosaico de que estudiar en la Universidad de Tecnología [started in October 1985] requería un conocimiento perfecto de los verbos irregulares, por lo que otra medición carecía de sentido. Como puede verse en la Fig. 3.1 anterior, el experimento arrojó resultados inesperados que demostraban que los intervalos crecientes entre repeticiones no tienen por qué ser mejores que los intervalos de duración constante. Afortunadamente, mucho antes de conocer los resultados del experimento, sospechaba que deben existir intervalos óptimos entre repeticiones. El principio de usar tales intervalos en el proceso de aprendizaje se conocería más adelante como el principio del espaciado óptimo de repetición.

Al escribir Historia de la repetición espaciada, encontré los gráficos originales en mi archivo. Es bastante obvio que la práctica masiva no es un buen enfoque:

Grupo A: espaciado distribuido en intervalos de 18 díasGrupo B: espaciado basado en intervalos crecientesGrupo C: espaciado masivo en intervalos de 5 días

¿Por qué la idea de la repetición espaciada triunfó al final?

La repetición espaciada es intuitiva. Tras cierta reflexión, incluso resulta obvia. ¿Por qué no dimos con soluciones antes? SuperMemo en papel habría sido viable tan pronto como la humanidad inventara el papel. Sin embargo, en la antigüedad, el volumen de conocimiento vital era lo bastante pequeño como para que el cerebro pudiera arreglárselas fácilmente desplegando métodos naturales de aprendizaje. Trabajando en el campo, el campesino adquiere rápidamente toda la experiencia necesaria que le permite destacar mientras la salud se lo permita.

Las cosas empezaron a cambiar con la llegada de la imprenta en el siglo XV. El conocimiento comenzó a proliferar y también ganó medios de perpetuación eficiente. Newton en los años de la peste podría ser un ejemplo interesante de un individuo que, en teoría, se habría beneficiado de la repetición espaciada. Sin embargo, la colección de libros de Newton era limitada y los problemas en los que pensar y que resolver eran tan numerosos que es fácil imaginar que nunca le habría preocupado su memoria fallando. Todo lo que necesitaba era tomar notas.

A lo largo de los dos siglos siguientes, las reservas de conocimiento disponible siguieron aumentando, y el apetito natural humano por recordar quizá aumentaba al mismo tiempo. La investigación de Ebbinghaus en la década de 1880 es un ejemplo de un interés continuo en el funcionamiento de la memoria. Sin embargo, incluso hoy, a la mayoría de los científicos rara vez les preocupa su propio olvido. Tomar notas y Google pueden satisfacer la mayoría de sus necesidades. Cuando Vannevar Bush concibió el dispositivo memex en la década de 1930, lo veía como una ampliación de la memoria. Sin embargo, aunque el memex pudiera verse como un primo lejano de la lectura incremental o la creatividad neural, todo su conocimiento, como en Google, vivía predominantemente fuera del cerebro humano. Mi búsqueda me recuerda a la de V. Bush, salvo que yo quiero que todo ese conocimiento deje una huella directa en la creatividad humana (véase: creatividad neural).

¿Por qué me preocupaba tanto el olvido? Hay muchos niños por ahí a los que les gusta lucirse en la escuela. Cuando mi hermano me enseñó a diferenciar las agujas de un abeto y de un pino, en mi clase de biología de 3.er grado, estaba ansioso por demostrar que sabía más que el niño promedio. Ese afán fue rápidamente suprimido por la escolarización, pero algunos rastros sobrevivieron. Cuando empezamos a estudiar química en 7.º grado, me sentía orgulloso de poder recordar nombres complejos como adenosín trifosfato o ácido desoxirribonucleico. Incluso buscaba nombres químicos difíciles para memorizar e impresionar. Memoricé los detalles de la anatomía de un pez sin mandíbula. De nuevo intenté impresionar en la escuela, pero a nadie le interesó.

Cuando profundicé más en la zoología en 5.º grado, apareció una especie de TOC por la información. Quería conocer todos los animales del zoológico de Poznan, su hábitat, e incluso su taxonomía y nombres en latín. Conseguí libros fantásticos con fotografías de todos los animales, y conocerlos me parecía una empresa interesante.

En 1974, me interesé por el boxeo, el fútbol y el deporte en general. Solía visitar el depósito de papel usado de nuestra escuela para buscar revistas deportivas. Mi compañero Robert me pidió que recopilara fotos de mujeres desnudas. Accedí. Mi pubertad llegó tarde y no me interesaba. Cuando el montón de fotos se desbordó en casa, se lo expliqué a mi madre: » ¡no son para mí!«. Ella asintió con compasión y una sonrisa. Mientras tanto, usaba una plancha para quitar las arrugas de mi colección reciclada de revistas deportivas. Las apilaba con esmero y las archivaba por fecha. La pila llenaba varios estantes de las estanterías de mi habitación. Esa pulcritud obsesiva habría resultado inquietante para cualquier padre; sin embargo, mi madre era tolerante. Era libre de seguir mis pasiones aunque parecieran absurdas. No me cabe duda de que la libertad es uno de los ingredientes vitales de un desarrollo saludable. ¿Acaso no muestran muchos niños síntomas similares con obsesiones por coleccionar sellos, postales y cromos de fútbol?

Algún impulso temprano hacia la lectura incremental se manifestó en algún momento entre los 10 y los 12 años. Empecé a tomar notas sobre caballos siguiendo enlaces en una enciclopedia de papel. Era divertido empezar con una entrada y esperar escribir un folleto sobre caballos con solo seguir los enlaces. En el primer curso de secundaria (a los 12 años), hice un ejercicio similar con una enciclopedia de mamíferos. Había una necesidad interna de codificar toda la información sobre ciertos temas de biología. Decidí escribir un libro del tamaño de una enciclopedia sobre el mundo vivo. Usé una máquina de escribir en el trabajo de mi madre y mis propias e ricas ilustraciones para escribir la historia de la evolución. Nunca lo terminé. La futilidad de ese ejercicio debería ser obvia. Nunca me molestó. El esfuerzo era placentero y adictivo.

Mostré una naturaleza informívora similar cuando empecé a aprender zoología, química, biología y más tarde bioquímica durante las vacaciones de verano de 1977 a 1979 (entre los 13 y los 15 años). Este fue el inicio definitivo de mi creciente necesidad de recordar. Producía libros escritos caligráficamente y meticulosamente ilustrados con mis conocimientos recién adquiridos. Sin embargo, tras un tiempo, ese conocimiento tendía a evaporarse. Esa futilidad empezó a inquietarme poco a poco. ¿De qué sirve escribir libros si pronto se convierten en el mismo material muerto que todos los demás libros del estante?

Hacia 1981-1982 (a los 19-20 años), comencé a plasmar mis conocimientos en forma de preguntas y respuestas para pruebas de recuerdo activo. Sabía que esa era la única forma de preservar las cosas en la memoria por más tiempo. Ni que decir tiene que, tras un tiempo, el repaso caótico tampoco me proporcionaba plena satisfacción. En esa etapa, tenía claramente mucha hambre de conocimiento. Quería recordar. Las intuiciones simples llevaron a experimentos simples y luego a un simple SuperMemo para DOS. Me impulsaba la búsqueda de aplicaciones prácticas que combinaran la investigación con el placer de aprender.

A partir de ese momento, mi camino se volvió determinista. Amaba demasiado el aprendizaje como para renunciar a SuperMemo en tiempos difíciles. Mi amor por el aprendizaje se veía fácilmente reprimido en la escuela o cuando estaba ocupado dirigiendo un negocio. Sin embargo, una vez que decidí trabajar desde casa (1997), se estableció el ciclo de retroalimentación positiva entre el aprendizaje, el amor por aprender y el progreso de SuperMemo. Como esto también resulta ser la forma en que me gano la vida, ese ciclo es para siempre. Solo la mala salud o la muerte pueden romper este ciclo. Esa parte de la fórmula del progreso es fácil de resolver.

¿Qué podrían hacer los padres para facilitar pasiones similares en los niños? Creo que entran en juego dos ingredientes: inspiración y libertad. Aunque la inspiración es útil, la libertad es esencial. Hoy en día, la inspiración se encuentra por todas partes. YouTube desempeña un papel enorme allí donde los humanos no están a la altura. En todo el mundo, el ingrediente que más falta es precisamente la libertad. Los niños están esclavizados por la escolarización. También están esclavizados por la crianza autoritaria. Me han dicho muchas veces que algunos de mis comportamientos alocados son un efecto secundario de haber crecido sin padre. Esto podría ser cierto. Sin embargo, para compensar, tuve tres padres. Mi madre y dos hermanos mayores: un hermano inspirador y una hermana sin hijos que canaló todo su amor hacia el mocoso que era yo. Me atrevo a afirmar que llegué a este mundo con una dotación razonable, no muy por encima de la media. A menudo me quedaba rezagado en la clase. Rara vez estaba en la delantera. Tengo docenas de ejemplos en los que convertí habilidades escasas o un poco de talento en excelencia en un área estrecha de búsquedas creativas. La libertad y la furia por dominar fueron siempre los ingredientes clave. Cuando criaba docenas de animales o recolectaba partes de cuerpos muertos, mi familia podía preguntar: » ¿por qué el niño no va a la iglesia en su lugar?«. Mi madre me protegía de esas influencias y preocupaciones. Podía hacer las cosas a mi manera.

Mi desarrollo se vio impulsado principalmente por el impacto de la libertad. La libertad ayuda a que prospere el impulso de aprender, y el impulso de aprender tiene poderes autoamplificadores. Esto me llevó a obsesiones que hoy me permiten alardear de ser el padre de la repetición espaciada. Las pasiones y obsesiones deberían apreciarse. En cambio, tendemos a exterminarlas en nombre de la robotización del desarrollo. Fijamos puntos de referencia y pedimos a los niños que salten a través de los aros. Como si ser guiado de la mano a través de la universidad hubiera contribuido jamás al pensamiento independiente de alguien. ¡Este proceso decorticante debe detenerse! El futuro pertenece al aprendizaje libre.

En cuanto a la repetición espaciada, el apetito por resolver el problema del olvido aumentó sustancialmente con la llegada de los ordenadores personales. A principios de los años 90, escuchaba con creciente frecuencia a usuarios de SuperMemo decir que habían pensado en una solución similar por sí mismos, pero que decidieron buscar primero una aplicación de software específica.

Son las exigencias de la escuela las que causan hoy la mayoría de las frustraciones en los estudiantes; sin embargo, las escuelas no son un buen lugar para el pensamiento creativo. Los estudiantes acuden en masa a la repetición espaciada sobre todo porque se les sirve en bandeja de plata. Está lista para consumir. Muy pocos contemplan sus propias soluciones.

Además de las libertades personales, algunas de las buenas fortunas que dieron un buen comienzo a SuperMemo fueron: (1) la universidad gratuita en la Polonia comunista, (2) el patrocinio familiar para comprar un PC escandalosamente caro, (3) escuelas indulgentes que no imponían mucho sobre mi tiempo libre, etc.

No verás a muchos jóvenes de 22-24 años dedicándose a su propia ciencia a costa del estado o de su familia. No hay nada de malo en que los adultos jóvenes vivan con sus padres si persiguen objetivos creativos.

La repetición espaciada nació en la confluencia de buenas fuerzas: el aprendizaje libre en un sistema comunista, la transición del comunismo a la economía de mercado, y la llegada de la computación personal. Eso se vio impulsado por la libertad en el hogar y una dosis de obsesión saludable por el aprendizaje. El ingrediente principal de esa ecuación es la libertad. La libertad es replicable. Solo hace falta concederla.

La primera década de SuperMemo: luchando contra el escepticismo

El escepticismo rodeó los primeros días de SuperMemo en Polonia. Esto se expresó con bastante precisión en la revista informática polaca Enter en 1994 (véase el artículo completo):

SuperMemo podría funcionar, pero no puede ser tan bueno
Si uno está convencido de la validez de lo que se ha dicho sobre SuperMemo, ¿estará ya convencido de que el programa es una cura perfecta para la memoria enferma? ¿Puede realmente capitalizar las propiedades del sistema nervioso y hacer que el aprendizaje avance una docena de veces más rápido que en circunstancias normales? Al fin y al cabo, ha habido generaciones de estudiantes tratando de encontrar mejores métodos de aprendizaje, y un avance comparable a SuperMemo parece muy poco probable incluso para un observador bastante de mente abierta. Wozniak descarta el argumento de la baja probabilidad como fuente viable de escepticismo, y dice que en más de una ocasión ha rastreado evidencia de que enfoques similares a SuperMemo para el aprendizaje ya se han intentado antes con mayor o menor grado de éxito. Además, vale la pena notar que SuperMemo quizá nunca hubiera visto la luz de no haberse implementado como un programa informático que puede transferirse fácilmente entre personas. En otras palabras, podría haber caído en el olvido como los intentos anteriores de poner orden en el proceso de aprendizaje. Hay que recordar que el algoritmo esquelético de SuperMemo se formuló en 1985, y solo en 1987 tuvo su muy lenta expansión en círculos científicos selectos de Poznan. Otro punto de inflexión a tener en cuenta es que SuperMemo World no se habría formado en 1991 de no haber sido por el inspirador encuentro de mentes entre Wozniak y su colega de la universidad, Krzysztof Biedalak, actualmente Vicepresidente de SuperMemo World. Ambos, los mejores estudiantes de la universidad, Wozniak pretendía estudiar neurociencia en EE. UU., y Biedalak quería hacer lo mismo en el campo de la inteligencia artificial. Solo por coincidencia, ambos se vieron lanzados al mundo de la ciencia emprendedora. Todo esto demuestra que, a pesar de que los principios de SuperMemo son extremadamente simples y podrían haberse inventado varias docenas de veces de forma independiente en varias docenas de países del planeta, SuperMemo no es un producto cualquiera. El mérito distintivo de SuperMemo World fue poner la idea en práctica, invertir una gran cantidad de horas-hombre en el desarrollo del software, y centrarse en comercializar la idea al cliente potencial. De lo contrario, SuperMemo habría permanecido para siempre limitado al pequeño círculo de sus primeros entusiastas.

El futuro es prometedor

Mencioné que el progreso de la repetición espaciada se ha visto frenado por conjeturas, un débil conjunto de herramientas prácticas y confusión terminológica. Hoy, todos esos factores quedan atrás. Surgen nuevas aplicaciones web que combinan macrodatos y las necesidades prácticas de los usuarios. Todas usan la misma terminología: curva del olvidoefecto del espaciado, y repetición espaciada. El futuro del aprendizaje se ve más brillante que nunca.