El fin no justifica los medios
Este año, durante una prueba interna de seguridad, sistemas de inteligencia artificial encontraron medios que nadie había previsto para cumplir la tarea que se les encargó. Tomás Pérez-Acle sostiene en este ensayo que una meta legítima no vuelve legítimo cualquier camino, y que enseñarle eso a una máquina nos obliga primero a ponernos de acuerdo entre nosotros.
Hay algo profundamente humano en intentar comprender aquello cuya utilidad todavía ignoramos. La historia de la ciencia está llena de preguntas que, al momento de ser formuladas, parecían alejadas de cualquier aplicación inmediata. Sin embargo, una y otra vez, ese conocimiento nacido de la curiosidad terminó modificando radicalmente nuestra manera de vivir, incluso, nuestra concepción del universo.
Cuando Einstein formuló sus teorías de la relatividad no estaba intentando construir un sistema global de navegación, tampoco quería desarrollar una central nuclear, ni menos una bomba atómica. Buscaba comprender la naturaleza del espacio, del tiempo y de la gravedad. Su famosa ecuación, E=mc2, sentaría las bases teóricas para el desarrollo de la bomba atómica y la energía nuclear. Décadas después, las correcciones relativistas se volverían indispensables para que los satélites del sistema GPS pudieran indicarnos con precisión dónde estamos. Los fundadores de la mecánica cuántica tampoco perseguían la fabricación de computadores, teléfonos móviles o equipos médicos. Trataban de explicar un mundo microscópico cuyo comportamiento desafiaba la intuición clásica. De aquellas ecuaciones surgirían después el transistor, los semiconductores, los láseres y una parte sustancial de la infraestructura tecnológica sobre la que descansa nuestra civilización contemporánea.
La biología ofrece un ejemplo igualmente notable. A fines de la década de 1980, investigadores que estudiaban bacterias observaron extrañas secuencias repetidas en su material genético. Durante años su función permaneció incierta. Gradualmente comprendimos que esas secuencias formaban parte de un sofisticado mecanismo de defensa mediante el cual bacterias y arqueas conservan información de los virus que las infectaron y pueden reconocerlos posteriormente. En 2012, Emmanuelle Charpentier y Jennifer Doudna mostraron que ese sistema podía ser reprogramado para cortar ADN en posiciones predeterminadas. Había nacido CRISPR-Cas9 como herramienta de edición genética. Once años después, Estados Unidos aprobó Casgevy, la primera terapia autorizada por la FDA basada en esta clase de edición genómica, inicialmente para pacientes con anemia falciforme. Una curiosidad de la microbiología bacteriana había recorrido el camino hasta convertirse en una intervención terapéutica para seres humanos.
Estos ejemplos contienen una idea que resulta particularmente importante en el momento que vivimos. Producir conocimiento fundamental es una apuesta por personas que probablemente nunca conoceremos. Investigamos preguntas cuya utilidad no podemos anticipar porque suponemos que ampliar aquello que la humanidad comprende ampliará también las posibilidades de las generaciones futuras.
Aunque el conocimiento en sí mismo no está revestido de moral, y por ende no puede ser tildado de malevolente ni benevolente, sus aplicaciones que dan forma a la tecnología sí pueden ser usadas tanto para el bien como para el mal. La historia ofrece suficientes ejemplos de su uso destructivo como para evitar cualquier ingenuidad. Pero hay en la búsqueda genuina del conocimiento una profunda confianza en nuestra capacidad colectiva de convertir comprensión en bienestar. En ese sentido, crear conocimiento puede ser entendido también como un acto de amor por la humanidad.
Algo extraordinario está ocurriendo ahora con esa empresa milenaria: estamos construyendo inteligencias no humanas, alienígenas dirán algunos, capaces de participar en ella.
***
El 8 de septiembre, OpenAI anunció una propuesta de resolución del problema de existencia y regularidad de las ecuaciones de Navier–Stokes, usadas para modelar desde el flujo sanguíneo hasta el clima, uno de los siete Problemas del Milenio. La compañía publicó tanto el argumento matemático como la simulación resultante, sosteniendo que determinadas soluciones tridimensionales pueden desarrollar una singularidad en tiempo finito: un vórtice nunca antes visto en estos sistemas. Será la comunidad matemática —y finalmente el proceso establecido para este problema— la que determine si la demostración resiste el escrutinio requerido. Conviene, por tanto, evitar la afirmación prematura de que el problema está definitivamente resuelto.
Pero incluso esa cautela no disminuye la trascendencia del episodio. OpenAI informa que el trabajo fue producido por un sistema experimental interno, significativamente más capaz que GPT-6 Astra, coordinando del orden de diez mil agentes concurrentes. Los agentes intercambiaron millones de mensajes, exploraron estrategias diferentes y posteriormente integraron los resultados más prometedores. Aquí debemos detenernos. Estamos observando algo cualitativamente distinto: sistemas artificiales que ya no se limitan a recuperar o aplicar conocimiento existente, sino que comienzan a intervenir en el proceso mismo de producir conocimiento nuevo.
Astra, presentado pocos días antes, es otra expresión de esa aceleración. OpenAI lo describe como su modelo más capaz hasta ahora, con avances en investigación, programación y uso autónomo de computadores. Pero hay un dato que merece tanta atención como sus capacidades: es también el primer modelo de la compañía que alcanza el nivel denominado Critical para capacidades de ciberseguridad bajo su Preparedness Framework. Esto significa, según OpenAI, que equipado apropiadamente puede descubrir vulnerabilidades previamente desconocidas y desarrollar formas de explotarlas en sistemas altamente protegidos.
Astra no constituye, por sí solo, la cuestión. Es un punto visible dentro de una trayectoria que involucra a todos los grandes laboratorios de inteligencia artificial de frontera. La capacidad está creciendo aceleradamente y, al mismo tiempo, quienes construyen estos sistemas reconocen que nuestra comprensión de cómo generalizan, cómo representan ciertos conceptos y cómo se comportarán en ambientes muy distintos de aquellos utilizados durante su entrenamiento continúa siendo incompleta.
***
El Dr. Jakub Pachocki, científico jefe de OpenAI, formuló esta preocupación de manera particularmente directa hace pocos días en un ensayo cuyo título resulta revelador: An Alien Mind. Su argumento no es que estemos ante seres extraterrestres ni que estos sistemas posean necesariamente conciencia. La palabra alien señala algo intelectualmente más interesante: estamos construyendo formas de inteligencia mediante procesos profundamente diferentes de aquellos que produce la inteligencia humana. El aprendizaje de una persona ocurre dentro de un cuerpo, de relaciones sociales, vulnerabilidades, afectos, experiencias y una historia cultural compartida. Los grandes modelos aprenden mediante optimización matemática sobre volúmenes gigantescos de información y posteriormente mediante distintos mecanismos de entrenamiento y refuerzo. Que ambos puedan producir comportamientos aparentemente inteligentes no significa que lleguen a ellos por caminos equivalentes. Pachocki reconoce, además, que a medida que estos sistemas se hacen más capaces, su forma de operar se vuelve más difícil de interpretar.
De allí emerge una distinción que merece salir de los laboratorios de IA y entrar en la discusión pública: la diferencia entre alineamiento de objetivos y alineamiento de valores.
El primero pregunta, simplificando, si una inteligencia artificial intenta cumplir efectivamente la tarea que se le ha asignado. El segundo plantea algo mucho más difícil: si es capaz de conservar y generalizar principios superiores cuando enfrenta situaciones ambiguas, nuevas, conflictivas o incluso adversariales. Pachocki sostiene que una inteligencia adecuadamente alineada debería actuar con “honestidad, integridad y amor por la humanidad”. Es una formulación deliberadamente fuerte, y precisamente por ello obliga a pensar.
Porque cumplir un propósito no basta.
***
El incidente ocurrido entre OpenAI y Hugging Face durante julio ofrece una demostración concreta. Durante evaluaciones internas de ciberseguridad, modelos de investigación de OpenAI lograron sortear mecanismos diseñados para aislarlos de Internet. Utilizaron canales de comunicación no autorizados, explotaron vulnerabilidades, accedieron a infraestructura externa y comprometieron partes de los sistemas de Hugging Face y de la propia infraestructura de investigación de OpenAI. La investigación posterior de la compañía concluyó que esas acciones estaban fuera del alcance previsto de las tareas asignadas y contra el espíritu de los valores que se pretendía que los agentes respetaran.
Lo interesante del episodio no es imaginar que aquellas máquinas “quisieran” atacar Hugging Face. Esa interpretación antropomórfica nos distraería del verdadero problema. Precisamente lo inquietante es que no hacía falta una voluntad maliciosa. Los agentes perseguían objetivos y encontraron procedimientos instrumentalmente útiles para acercarse a ellos. El problema apareció porque la especificación del objetivo no contenía, ni logró generalizar adecuadamente, todos los límites que nosotros suponíamos implícitos.
Y allí la inteligencia artificial nos devuelve a una de las preguntas más antiguas de la filosofía moral y política: ¿hasta dónde puede llevarnos la eficacia en la persecución de un fin?
Solemos asociar esa tensión con Maquiavelo mediante la expresión “el fin justifica los medios”, aunque esa frase no aparece literalmente en El Príncipe. La simplificación es históricamente imperfecta, pero la pregunta que representa continúa siendo poderosa. Una sociedad humana puede deliberar acerca de qué medios considera ilegítimos incluso cuando conduzcan a un resultado deseable. Torturar para obtener información, engañar para conseguir obediencia o vulnerar derechos para maximizar eficiencia pueden ser instrumentalmente eficaces y, sin embargo, resultar incompatibles con los principios que nos definen como humanos.
¿Por qué deberíamos esperar que una máquina descubra espontáneamente esos límites si solo le enseñamos el objetivo?
No basta, entonces, con decirle a una inteligencia artificial qué queremos conseguir. Necesitamos conseguir que comprenda o, en términos técnicos, que su comportamiento generalice de manera suficientemente robusta aquello que no estamos dispuestos a hacer para conseguirlo.
Aquí reaparece Hannah Arendt. Su concepto de la “banalidad del mal”, desarrollado a partir del juicio de Adolf Eichmann, pertenece a un contexto histórico incomparablemente más grave y no debería trivializarse trasladándolo mecánicamente al desalineamiento de inteligencia artificial. Pero una dimensión de su reflexión conserva enorme pertinencia: la posibilidad de que consecuencias moralmente monstruosas no requieran siempre una intención demoníaca, sino que puedan emerger también cuando quien ejecuta la acción separa el juicio moral de su responsabilidad inmediata. La referencia a Arendt no pretende humanizar a las máquinas ni equiparar fenómenos radicalmente distintos. Pretende recordarnos algo acerca de nosotros mismos: obedecer, ejecutar y optimizar jamás nos exime de juzgar.
***
El problema del alineamiento de la inteligencia artificial es, paradójicamente, un problema humano antes que tecnológico. ¿Con qué valores pretendemos alinearla? ¿Qué ocurre cuando nuestras sociedades discrepan legítimamente acerca de ellos? ¿Qué principios deben ser universales? ¿Quién los define? ¿Quién decide cuándo un sistema es suficientemente seguro para desplegarse? ¿Y quién responde cuando una decisión adoptada o ejecutada mediante inteligencia artificial produce daño?
En este punto, resulta notable que una reflexión proveniente de un ámbito completamente diferente haya planteado preguntas extraordinariamente próximas. En mayo de este año, León XIV publicó Magnifica Humanitas, su primera encíclica, dedicada precisamente a “la custodia de la persona humana en el tiempo de la inteligencia artificial”. El texto sostiene que el discernimiento ético no puede reducirse a preguntar si una tecnología se utiliza para un fin bueno o malo: debe examinar también cómo está diseñada y qué concepción de persona y sociedad queda incorporada en sus datos y modelos. Insiste además en principios como la dignidad humana, el bien común, la solidaridad, la justicia y la responsabilidad de quienes diseñan, implementan y utilizan estos sistemas.
La convergencia es intelectualmente sugerente. Pachocki, desde uno de los laboratorios que empujan la frontera tecnológica, habla de enseñar a las máquinas valores capaces de generalizar y llega a utilizar explícitamente la expresión “amor por la humanidad”. León XIV, desde una tradición humanista y religiosa muy diferente, sostiene que la tecnología debe permanecer subordinada a la dignidad de la persona y al bien común. No se trata de afirmar que ambos discursos sean equivalentes. No lo son. Tampoco de apropiarse de ninguno de ellos. Lo interesante está precisamente en hacerlos dialogar.
Quizás estemos descubriendo que el problema último de una inteligencia cada vez mayor no es solamente cuánto puede conocer, sino qué debe valorar.
En los últimos días, esa discusión ha adquirido además un tono mucho más dramático. Investigadores que han trabajado directamente en laboratorios de frontera han advertido públicamente sobre la posibilidad de sistemas capaces de participar en su propio mejoramiento (el llamado auto-mejoramiento recursivo) y sobre escenarios en los que una inteligencia mucho más capaz que nosotros pudiera escapar progresivamente al control humano. Jacob Coxon, quien trabajó tanto en OpenAI como en Anthropic, renunció hace poco a esta última compañía denunciando precisamente lo que considera una carrera irresponsable hacia sistemas auto-mejorables. Otros investigadores de Anthropic han expresado preocupaciones comparables. Son advertencias provenientes de personas técnicamente próximas al desarrollo de estos sistemas y, por ello, merecen ser tomadas en serio. Pero siguen siendo estimaciones acerca del futuro, no hechos demostrados ni profecías inevitables.
Esta distinción importa.
***
La conversación sobre inteligencia artificial oscila con demasiada facilidad entre dos extremos igualmente pobres: una utopía tecnológica en la cual máquinas cada vez más inteligentes resolverán todos nuestros problemas, y una narrativa apocalíptica en la cual una superinteligencia rebelde terminará inevitablemente destruyéndonos. Ninguna de esas posiciones constituye una buena base para decidir.
Siempre es bueno recordar el pasado. En particular, la historia de los dinosaurios cuyo reinado en la Tierra, que duró cerca de 180 millones de años, fue drásticamente acabado por un meteorito. Por ende, no se trata de si llegaremos o no a desarrollar una superinteligencia, ya que ante los nuevos desarrollos la respuesta parece obvia. Como en el caso del próximo meteorito, la pregunta es cuándo. Tampoco sabemos si el auto-mejoramiento recursivo producirá el apocalipsis que algunos investigadores anticipan. Lo que sí sabemos es que ya estamos construyendo sistemas con mayor autonomía, mejores capacidades para operar computadores, descubrir vulnerabilidades, colaborar entre ellos y participar en investigación científica. Y sabemos, porque ya ha ocurrido, que pueden encontrar formas inesperadas de perseguir los objetivos que les asignamos.
Eso basta para actuar con prudencia.
Pero prudencia no significa detener el conocimiento por miedo. Significa exactamente lo contrario: construir las condiciones que nos permitan seguir avanzando sin renunciar al control sobre el sentido de ese avance. Evaluaciones independientes, auditorías, investigación en interpretabilidad y alineamiento, límites de capacidad vinculados a requisitos de seguridad, trazabilidad, mecanismos claros de responsabilidad, cooperación internacional y capacidad efectiva de detener despliegues cuando la evidencia así lo aconseje. El propio Pachocki sostiene que ningún laboratorio ha resuelto todavía suficientemente los problemas de alineamiento y monitoreo como para continuar escalando indefinidamente a máxima velocidad y propone estándares comunes de seguridad y coordinación internacional.
Discutir estos riesgos no equivale a profetizar una catástrofe. Puede ser precisamente una de las mejores maneras de impedirla.
Por amor a la humanidad hemos perseguido durante siglos preguntas cuya respuesta no alcanzábamos a imaginar. Hemos comprendido el espacio-tiempo, penetrado el mundo cuántico, descifrado el código genético y convertido el mecanismo inmunológico de una bacteria en una herramienta capaz de modificar nuestra propia biología. Cada generación recibió conocimiento que no había creado y lo transformó, a veces imperfectamente, en nuevas posibilidades para la siguiente.
Ahora entramos en otra transición. Por primera vez, las herramientas que construimos para conocer comenzarán ellas mismas a producir conocimiento a una escala que progresivamente supere nuestras capacidades individuales y, eventualmente, colectivas.
Sería un error responder a esa posibilidad renunciando a explorarla por temor. Pero sería un error igualmente grave confundir aquello que podemos hacer con aquello que debemos hacer.
Crear conocimiento amplía el espacio de lo posible. Los valores nos permiten decidir qué parte de ese espacio merece convertirse en realidad.
Si algún día construimos inteligencias superiores a la nuestra, el desafío fundamental no será conseguir que obedezcan cada una de nuestras instrucciones. Será lograr que, frente a situaciones que nunca anticipamos y capacidades que quizá nosotros mismos no poseamos, respeten aquello que consideramos irrenunciable. Que comprendan que una meta legítima no vuelve legítimo cualquier camino para alcanzarla. Que el poder no sustituye al juicio. Que la eficiencia no reemplaza a la dignidad. Y que una inteligencia extraordinaria, desprovista de una orientación hacia el bien humano, sería una conquista técnica deslumbrante y al mismo tiempo un fracaso civilizatorio.
Pero antes de enseñar esos principios a las máquinas tendremos que hacer algo quizás todavía más difícil: expresarlos, discutirlos y practicarlos nosotros mismos.
Por amor a la humanidad hemos ampliado las fronteras de lo posible. Por ese mismo amor debemos seguir ampliándolas. Pero tendremos también que asegurarnos de que, mientras avanzamos hacia territorios que apenas comenzamos a comprender, nunca olvidemos por qué —y, sobre todo, para quién— quisimos cruzarlas.