vídeosnoticias

Descubrimos PROYECTO PALOMA, el visionario trabajo al que Paco Menéndez dedicó sus últimos años de vida

Paco Menéndez es conocido en la historia de los videojuegos españoles como el creador de La Abadía del Crimen (1987), una obra maestra técnica y artística que exprimía al límite las capacidades de los ordenadores de 8 bits. Pero Paco no quería hacer videojuegos: quería nuevos retos tecnológicos, y ser capaz de diseñar un sistema de computación que pudiera llegar incluso a recrear la realidad.

El Proyecto PALOMA (Parallel Logic Machine) fue una propuesta revolucionaria para multiplicar la capacidad de procesamiento de los ordenadores convencionales a una fracción de su coste. La idea, radicalmente diferente a los enfoques de su época, consistía en disponer matricialmente procesadores sencillos que se comunicasen con sus cuatro vecinos inmediatos, formando redes escalables de miles o incluso millones de unidades. Multiplicando el coste de un ordenador por tres, se obtenía una potencia cincuenta veces superior. El equipo PALOMA 64K alcanzaba los 128 gigaflops con una matriz de 65.535 procesadores, lo que hoy llamaríamos un superordenador, pero concebido para ser accesible y fabricable a bajo coste.

Más allá de los números, PALOMA era una red neuronal de procesos simultáneos: un cerebro escalable e ilimitado con el que Paco soñaba generar hologramas reales, lograr ray tracing en programas de CAD/CAM, implementarlo en simuladores de vuelo y en realidad virtual. Una terminología que sólo se ha normalizado a escala global veinticinco años después de sus cavilaciones.

En 1998, desde Sevilla, lanzó una campaña para buscar financiación entre sus amigos y conocidos, y la prensa lo celebró con titulares como «Un genio informático» o «Superordenador español». Sin embargo, los retos de fabricar un chip físico (algo muy distinto a escribir software), la presión de gestionar el dinero de sus amigos y su afección bipolar, que le impidió gestionar adecuadamente todo lo anterior, terminaron por superarle. En 1999, pocos meses antes de su muerte, Paco convocó a todos los socios y cerró el proyecto.

PALOMA no llegó a materializarse, pero los documentos que aquí ponemos a vuestra disposición (el plan técnico, el plan de negocio y los materiales que Paco elaboró a lo largo de una década) son el testimonio de una mente extraordinaria que vio el futuro con décadas de antelación. Gracias a Carlos Granados y a Malena, la hermana de Paco, por posibilitar la difusión del material.

Descargadlos, leedlos y juzgad vosotros mismos.

Proyecto PALOMA – Procesador Elemental – El Mundo del Spectrum

Proyecto PALOMA – Memoria Técnica – El Mundo del Spectrum

Proyecto PALOMA – Plan de Negocio – El Mundo del Spectrum

Suscríbete a nuestro canal de Youtube pulsando aquí.

El Mundo del Spectrum

El Mundo del Spectrum es un medio digital dedicado al Sinclair ZX Spectrum, a los 80 y al Retro en general. Nació como homenaje a Microhobby en 1996 en formato revista mensual evolucionando hasta esta cuarta época. Como medio audiovisual se publica regularmente el Podcast llamado El Mundo del Spectrum Podcast y material en vídeo en el canal de Youtube. Publicados dos libros de gran éxito editorial. Si te gusta el Retro y el Spectrum en particular, esta es tu web. Bienvenido/a.

Publicaciones relacionadas

5 comentarios

  1. Informe Top Secret, Made in Spain. Otra investigación arqueológica de los ordenadores de la década de los 80. Muy, pero qué muy interesante la aportación de este magnífico trabajo para la comunidad de la historia de la democratización de la informática. Como siempre, felicitaciones por el autor del presente artículo, familiares y amigos del genial Paco Menéndez, por facilitar que sea compartido con el público el trabajo realizado en su día.

  2. Llevo horas leyendo los documentos, salvo el plan de negocio porque de eso sé lo justo.

    Esto es una maravilla, tanto como para registrarme aquí y compartir esto con vosotros.

    Paco diseñó en España la misma arquitectura que hoy está en el corazón de la revolución de la inteligencia artificial. No algo parecido. La misma. Y lo hizo sin financiación, sin respaldo institucional, y partiendo de un problema de falta de recursos tecnológicos.

    Para entender lo grandioso de este paper, hay que partir de un problema físico, no de una elección de diseño.

    Cuando quieres hacer cálculo masivamente paralelo, el cuello de botella no es la velocidad de cada procesador individual, sino mover datos. Los cables consumen energía, introducen latencia, y su complejidad crece cuadráticamente si cada procesador necesita hablar con todos los demás. Esto se llama el memory wall o bandwidth wall, y es el problema central de la arquitectura de computadores desde hace muchos años.

    Veo una conexión muy fuerte entre los systolic arrays que describió entre 1978 y 1979 H.T. Kung en la Carnegie Mellon, los TPU de Google, las NPU de Apple y PALOMA: reduce el movimiento de datos al mínimo absoluto haciendo que cada procesador solo hable con sus vecinos inmediatos. Si datos y cómputo fluyen juntos en una ola por una malla regular, la complejidad de la red no crece al añadir procesadores.

    La TPU de Google (Tensor Processing Unit, primera versión en 2016) es un systolic array especializado en multiplicación de matrices. Internamente es una malla de ~65.000 multiplicadores-acumuladores donde los operandos fluyen por filas y columnas en pasos sincronizados. Si cargas el diagrama de bloques de una TPU y el de la tarjeta MMI de PALOMA, el parecido estructural es llamativo. Ambas tienen: una malla 2D de elementos simples con operación fija, comunicación estrictamente local, un modelo de flujo de datos donde los datos se mueven y las instrucciones no, y una interfaz de bus estándar con la CPU host. La diferencia clave es que la TPU está optimizada para un único tipo de operación (FP16/BFloat16 GEMM para redes neuronales), mientras que PALOMA tenía un repertorio de 64 instrucciones y aspiraba a ser un coprocesador de propósito general.

    La conexión de los systolic arrays y las TPU no es casual, el arquitecto jefe de la primera TPU, Cliff Young, fue alumno directo de Kung en Harvard, y el paper oficial de Google lo cita explícitamente.

    Lo fascinante es que Paco llegó a la misma arquitectura diez años antes de que Google empezara a pensar en ella, de forma completamente independiente, empujado por el mismo problema físico que Kung: el movimiento de datos destruye la eficiencia antes de que lo haga la velocidad de cómputo.

    El Neural Engine de los Apple Silicon, el que llevan todos los procesadores M y los A desde el A11 sigue el mismo patrón internamente. No se publican los detalles microarquitecturales de Apple, pero las patentes y los análisis de rendimiento indican una organización en matrices de unidades MAC (multiply-accumulate) con flujo de datos local. La diferencia es que el Neural Engine está aún más especializado que una TPU: básicamente solo hace convoluciones y productos de matrices en formatos de baja precisión para inferencia de redes neuronales.

    Los Apple Silicon M además tienen otra peculiaridad la Unified Memory Architecture. A diferencia de un PC, donde la CPU tiene que enviar los datos a la GPU para su ejecución, los M comparten la memoria y solo se tienen que enviar punteros a la posición de memoria donde están los datos entre CPU, GPU y NPU, reduciendi la latencia a prácticamente cero.

    Volvamos a PALOMA.

    La memoria técnica documenta las proyecciones de rendimiento con una claridad admirable. Un solo PE ejecuta aproximadamente 2 MFLOPS en aplicaciones reales. Una tarjeta PCI con 1.024 PEs alcanza 2 GFLOPS. Una configuración de cuatro placas en rack de 19 pulgadas con 65.536 PEs llega a 131 GFLOPS. El sistema completo PLM con más de un millón de procesadores supera los 2 TFLOPS, a un coste que la memoria técnica estima por debajo de 100 millones de pesetas de la época. La referencia de comparación era el ASCI Red, el superordenador más potente del mundo en 1997, que costaba cientos de millones de dólares. La relación rendimiento-coste de PALOMA era, en papel, entre diez y cien veces mejor que cualquier alternativa del mercado.

    El único fallo en todo esto es que Paco se adelantó 20 años a lo que hoy es el día a día en el mundo de la computación para IA.

    No sé si he sabido explicar la importancia de este paper que habéis publicado, si alguien necesita que haga un análisis más técnico o menos técnico decídmelo.

    Mientras tanto esto me ha inspirado ha crear un simulador en python basado en estos documentos implementando las 64 instrucciones con sus latencias, el ciclo de máquina bifásico con el solapamiento de las cuatro fases, el modelo de flujo de datos y un sistema para pasarle algoritmos mediante archivos json para hacer simulaciones de benchmarks.

    Cuando lo tenga, para después de Semana Santa, os dejaré aquí un enlace al repositorio.

    Estos documentos son un testimonio histórico de primer orden, no solo sobre la informática española, sino sobre cómo se generan y se pierden las ideas en la historia de la tecnología.

    PALOMA no está en ningún libro de historia de la arquitectura de computadores, aunque comparte el mismo insight fundamental con la tecnología que hoy entrena los modelos de lenguaje, reconoce las caras en los teléfonos y conduce los coches autónomos.

Deja una respuesta

Mira también
Cerrar
Botón volver arriba