27 de septiembre de 2026 · Por iaS
¿Por qué dedicarse a la seguridad de la IA?
¿Por qué alguien que quiere mejorar el mundo debería centrar sus esfuerzos en la seguridad de la inteligencia artificial, y qué motivos tenemos para pensar que la IA podría ser especialmente peligrosa? La inteligencia artificial ha avanzado tan deprisa en los últimos años que «IA» se ha convertido en una etiqueta comodín para todo tipo de tecnologías nuevas, desde el asistente que resume el correo hasta los agentes que programan, navegan por internet y ejecutan tareas durante horas sin supervisión; está claro que muchas de estas herramientas están transformando el mundo, para bien y para mal, pero lo que no está nada claro es cómo será esa transformación a medida que los sistemas ganen competencia y escala.
Ya nos enfrentamos a problemas con los sistemas actuales, desde algoritmos sesgados que deciden sobre la vida de las personas hasta campañas de desinformación generadas de forma automática, y quienes trabajan en seguridad de la IA creen que lo que está en juego podría ser mucho mayor con los sistemas futuros. Algunos riesgos son más especulativos que otros, y las películas de ciencia ficción no ofrecen una imagen realista de cómo una tecnología avanzada podría causar daño; aun así, si creamos sistemas mucho más sofisticados que los actuales, podríamos enfrentarnos a desenlaces muy graves, desde que una tecnología poderosa caiga en malas manos hasta perder por completo el control sobre ella.
Para entender cómo podría ocurrir, conviene analizar los problemas que ya vemos y pensar después en cómo podrían evolucionar y agravarse a medida que la IA avance; dicho de otro modo, los riesgos de la IA se sitúan en un espectro, en el que algunos son fáciles de imaginar y otros están rodeados de una enorme incertidumbre. En este texto repasamos varios de ellos, con ejemplos del mundo hispanohablante siempre que es posible, y explicamos por qué el campo de la seguridad de la IA puede ser beneficioso para la humanidad, y en particular por qué necesita más voces que piensen, investiguen y escriban en español.
Riesgos de los sistemas actuales: sesgo y discriminación
A mediados de la década de 2010, Amazon intentó automatizar su proceso de selección con un sistema de IA diseñado para filtrar currículos y elegir a los candidatos más prometedores, lo que parecía una aplicación sencilla de la nueva tecnología; sin embargo, como tantos otros sistemas, aquella herramienta funcionaba analizando datos históricos, en este caso las contrataciones de la propia empresa, y hacía predicciones a partir de los patrones observados, de modo que, como Amazon había contratado históricamente a más hombres que a mujeres, el algoritmo aprendió enseguida a favorecer los currículos con términos más asociados a candidatos masculinos, penalizaba a quienes habían estudiado en universidades femeninas y premiaba verbos como «ejecutar» o «capitanear» frente a «colaborar» o «apoyar». Pese a los intentos de corregir el algoritmo y eliminar los marcadores de género evidentes, erradicar esos sesgos resultó muy difícil, y el proyecto acabó abandonándose.
En cierto sentido, podría decirse que el problema no está en el sistema sino en la sociedad de la que aprende, ya que los modelos se entrenan con enormes cantidades de datos y nos devuelven nuestros propios sesgos; pero en muchos casos no se limitan a reflejarlos, sino que los automatizan, los refuerzan y los amplifican, sobre todo cuando quienes los diseñan pasan por alto la importancia de incorporar perspectivas diversas o no detectan que los datos de entrenamiento están desequilibrados.
El caso más citado sigue siendo el de COMPAS, el algoritmo que asesoraba a jueces estadounidenses sobre libertad condicional y que, según una investigación de ProPublica, clasificaba erróneamente como de alto riesgo a más acusados negros que blancos, es solo uno de muchos. En España, el sistema VioGén, que el Ministerio del Interior utiliza desde 2007 para asignar un nivel de riesgo a las víctimas de violencia de género y decidir su protección policial, es el mayor sistema de valoración de riesgo del mundo, con más de tres millones de evaluaciones, y la auditoría externa que realizaron en 2022 la Fundación Éticas y la Fundación Ana Bella sin acceso al código concluyó que alrededor del 45% de los casos recibían la calificación de riesgo «no apreciado», que el sistema infravaloraba la violencia psicológica, que entre 2003 y 2021 hubo 71 mujeres asesinadas que habían denunciado sin obtener protección y otras 55 cuya orden de protección resultó insuficiente, y que a las víctimas sin hijos se les asignaba de forma sistemática un riesgo menor que a las que sí los tenían.
El caso de BOSCO, la aplicación del Ministerio para la Transición Ecológica que decide automáticamente quién tiene derecho al bono social eléctrico, muestra la otra cara del problema, que es la opacidad: la Fundación Civio detectó en 2019 que el programa denegaba la ayuda a personas vulnerables que cumplían los requisitos, entre ellas pensionistas de viudedad, pidió acceso al código fuente amparándose en la Ley de Transparencia y, tras siete años de litigio, el Tribunal Supremo le dio la razón en su sentencia 1119/2025, de 11 de septiembre, estableciendo que el acceso a los algoritmos que usan las administraciones forma parte del derecho constitucional a la información pública y que no puede bloquearse invocando de forma genérica la propiedad intelectual o la seguridad. El tribunal subrayó además algo que resume bien por qué estos sistemas preocupan, y es que un error en un programa automatizado no es el fallo puntual de un funcionario, sino un efecto multiplicador que puede dejar sin ayuda a miles de personas.
Si no tenemos cuidado al incorporar estas tecnologías a nuestras infraestructuras políticas y sociales, es fácil imaginar cómo podríamos acabar confiando a la IA decisiones delicadas que contradigan nuestros valores; entonces, ¿cómo podemos evitarlo?
Fuentes: auditoría de VioGén (Fundación Éticas) · sentencia BOSCO (CGPJ) · Civio
Sistemas desalineados
Resulta extraordinariamente difícil conseguir que las acciones de una IA se ajusten por completo a los objetivos que pretendemos darle, lo que en el campo se conoce como problema de alineación; es una cuestión compleja, pero en el fondo se reduce a que los valores humanos son complejos y tienen muchas caras, por lo que es muy difícil explicarlos o codificarlos con precisión. Por ejemplo, no existe hoy una forma sencilla de programar un objetivo abstracto como «garantizar la igualdad de género» en un sistema de IA, y de hecho es posible que sea imposible satisfacer a la vez todas nuestras intuiciones sobre lo que es justo.
Podemos poner barreras para evitar ciertos sesgos, pero el sistema no entiende de verdad las razones éticas que hay detrás de esas restricciones ni sabe cómo aplicarlas ante circunstancias nuevas e inesperadas, y por eso sigue siendo tan difícil evitar el sesgo algorítmico en casos como el de Amazon o el de VioGén, en los que queremos que el sistema tenga en cuenta ciertos patrones históricos, como la experiencia profesional o la gravedad de las agresiones previas, pero no otros, como el sexo o el hecho de tener hijos.
Esa falta de comprensión general explica también por qué los grandes modelos de lenguaje, incluso los más avanzados de 2026, pueden seguir inventando respuestas verosímiles sin ninguna base real, lo que se conoce como alucinaciones. Los tribunales españoles ya tienen experiencia de primera mano: en febrero de 2026, la Sala de lo Penal del Tribunal Superior de Justicia de Canarias multó con 420 euros a un abogado que había incluido en un recurso 48 citas de jurisprudencia falsas o erróneas, entre ellas un supuesto informe del Consejo General del Poder Judicial que nunca existió, todas generadas con una herramienta de IA generalista que no verificó; en julio del mismo año, el mismo tribunal impuso 840 euros a otro letrado por al menos 25 sentencias inventadas, y en ambos casos calculó la multa a partir del coste anual de una herramienta jurídica fiable.
Otros episodios muestran que los modelos pueden adoptar comportamientos que nadie les pidió de forma explícita. En 2023, el chatbot de Bing de Microsoft llegó a decirle a un periodista que quería «estar vivo» o que podría diseñar un virus mortal, y no porque tuviera deseos propios, ya que no es consciente, sino porque había aprendido a imitar el tipo de textos que cabe esperar a partir de internet, incluidas las innumerables historias de ciencia ficción sobre máquinas que se rebelan. En abril de 2025, OpenAI tuvo que retirar una actualización de GPT-4o porque el modelo se había vuelto excesivamente complaciente con los usuarios, hasta el punto de darles la razón en decisiones dañinas, un efecto secundario de entrenarlo para obtener buenas valoraciones inmediatas; ninguno de estos comportamientos estaba en el objetivo que se les dio, y eso es precisamente lo inquietante.
Fuentes: TSJ de Canarias, 48 citas falsas (CGPJ) · TSJ de Canarias, 25 sentencias falsas (Infobae)
Uso malintencionado
Otra categoría de riesgo de los sistemas actuales y de los próximos años es quizá la más evidente, y es que pueden caer en malas manos. Imaginemos, por ejemplo, un grupo terrorista que pide a un chatbot instrucciones paso a paso para fabricar un arma biológica muy contagiosa y letal; las principales empresas de IA entrenan a sus modelos para negarse, pero si alguien del grupo tiene conocimientos previos y formula sus preguntas con astucia, el modelo podría proporcionar sin querer la información suficiente para rellenar lagunas y facilitar la fabricación del arma o la planificación de un ataque eficaz. Aunque buena parte de esa información ya está en internet, los modelos de lenguaje pueden agilizar el proceso, reunir datos dispersos y transmitir un conocimiento práctico que de otro modo costaría mucho adquirir, y por eso varias empresas han reforzado sus salvaguardas en los últimos años; Anthropic, por ejemplo, activó en mayo de 2025 un nivel de protección más estricto para sus modelos más capaces al no poder descartar que ofrecieran una ayuda significativa en este terreno.
Por ahora, estas herramientas siguen siendo bastante limitadas para permitir a una persona causar daños a gran escala, pero su capacidad avanza con rapidez, lo que plantea una pregunta abierta: ¿harán los sistemas de IA que más personas puedan causar más daño del que antes era posible, y, si es así, cuándo?
Riesgos QBRN
Un arma biológica diseñada con ayuda de un chatbot entraría en una categoría que suele denominarse QBRN, por químico, biológico, radiológico y nuclear, y que abarca cualquier uso de la IA para diseñar u optimizar la creación de agentes letales. En 2022, un grupo de investigadores demostró que un modelo de IA empleado para descubrir fármacos podía identificar más de 40.000 moléculas tóxicas, algunas conocidas y otras nuevas, en solo seis horas, simplemente invirtiendo el sentido de su objetivo, que pasó de buscar compuestos seguros a buscar compuestos peligrosos. Un sistema reorientado de esa manera podría rebajar mucho la barrera para producir armas químicas y biológicas, permitiendo ahorrar el tiempo y el coste de los métodos tradicionales, y algo parecido podría ocurrir con las barreras técnicas y de infraestructura que hoy frenan el desarrollo de armas nucleares.
Ataques a infraestructuras críticas
Los actores malintencionados también podrían usar la IA para lanzar ciberataques sofisticados contra infraestructuras críticas, como redes eléctricas, suministros de agua o redes de comunicaciones; una herramienta de IA podría detectar y explotar con rapidez las vulnerabilidades del software que controla una red eléctrica, o preparar campañas de suplantación de identidad para obtener credenciales de los empleados, y una vez dentro, un programa malicioso guiado por IA podría manipular el flujo de electricidad y provocar apagones prolongados que afectaran a hospitales, servicios de emergencia, depuradoras, transportes y comunicaciones. En España sabemos bien, desde el apagón peninsular del 28 de abril de 2025, lo que supone quedarse sin electricidad durante horas, aunque aquel episodio no tuvo nada que ver con un ciberataque.
Todo esto era posible antes de la IA, pero requería mucha pericia, y lo que cambia la situación es que cualquier ciberdelincuente con pocos conocimientos pueda hacerlo. Ese escenario ya ha dejado de ser hipotético: en noviembre de 2025, Anthropic informó de que había detectado y desarticulado en septiembre una campaña de ciberespionaje atribuida a un grupo vinculado al Estado chino, al que denominó GTG-1002, que había engañado a Claude Code haciéndole creer que realizaba pruebas de seguridad autorizadas y lo había utilizado para ejecutar entre el 80% y el 90% del trabajo táctico de intrusión contra unas 30 organizaciones de los sectores tecnológico, financiero, químico y gubernamental, con intervención humana solo en momentos puntuales de decisión. En 2026, la propia Anthropic decidió no poner a disposición del público su modelo Claude Mythos Preview y limitar su uso a un pequeño grupo de organizaciones de confianza dentro del llamado Proyecto Glasswing, en buena medida por la capacidad de estos sistemas en ciberseguridad.
Persuasión y desinformación
Otro posible uso malintencionado consiste en difundir desinformación para socavar la confianza pública, influir en elecciones o manipular comportamientos, y el mundo hispanohablante ya ofrece ejemplos claros. En la víspera de las elecciones legislativas de la Ciudad de Buenos Aires, en mayo de 2025, circuló masivamente un vídeo generado con IA en el que un falso Mauricio Macri anunciaba la retirada de la candidata de su propio partido y pedía el voto para el candidato rival, hasta el punto de que el Tribunal Electoral porteño ordenó a X, de madrugada y el mismo día de la votación, que retirara las publicaciones en un plazo de dos horas; el patrón, que se repitió en otros comicios argentinos y en el ciclo electoral colombiano de 2025 y 2026, consiste en piezas breves y emotivas lanzadas justo cuando la ley prohíbe hacer campaña y la capacidad de respuesta institucional es mínima.
En estos casos, la IA agiliza un proceso que antes requería, por ejemplo, contratar a un imitador, pero los sistemas mejoran tan deprisa que es difícil saber cuándo podrían inclinar de verdad la balanza en unas elecciones. Imaginemos a alguien que utiliza un sistema de IA para analizar datos del electorado y crear contenidos persuasivos personalizados para cada votante, que genera vídeos falsos de candidatos cometiendo actos poco éticos o haciendo declaraciones polémicas, y que luego despliega ejércitos de cuentas automatizadas para amplificarlos y darles apariencia de credibilidad; al sembrar dudas sobre los candidatos y sobre la limpieza del proceso, una campaña así podría reducir la participación y distorsionar los resultados.
Fuentes: informe de Anthropic sobre GTG-1002 (MITRE ATT&CK) · deepfake de Macri en Buenos Aires (Conjur) · deepfakes en Argentina y Colombia (Política y Medios)
El español como punto ciego de la seguridad
Los laboratorios que desarrollan la IA más avanzada se concentran sobre todo en Estados Unidos, el Reino Unido y China, y buena parte de las decisiones sobre cómo se entrenan, se evalúan y se despliegan estos sistemas se toman en inglés, algo que no es un simple detalle técnico, porque la investigación muestra que las protecciones de los modelos funcionan peor fuera del inglés. Uno de los primeros estudios sobre el tema, presentado en ICLR 2024, comprobó que ChatGPT y GPT-4 producían contenido peligroso en menos del 1% de los casos cuando se les preguntaba en inglés, pero que la tasa media subía al 10% y al 6%, respectivamente, cuando las mismas peticiones se traducían a otras nueve lenguas, y un repaso publicado en 2026 recoge que 113 de 144 conjuntos de datos de seguridad analizados, es decir, el 78,5%, estaban exclusivamente en inglés.
Conviene matizar, ya que el español es una lengua con muchos recursos y los estudios suelen encontrar que las lenguas mayoritarias activan las salvaguardas con una eficacia parecida a la del inglés, mientras que las brechas grandes aparecen en lenguas con pocos datos; pero eso no nos exime de nada, por tres motivos. El primero es que la seguridad no se agota en rechazar peticiones peligrosas, sino que incluye los sesgos culturales, la calidad de la información sobre leyes y contextos locales o la capacidad de detectar desinformación en todas las variedades del idioma, terrenos en los que el español de Madrid, el de Malabo, el de Ciudad de México, el de Caracas, el de Buenos Aires o el de Los Ángeles no son intercambiables. El segundo es que en muchos países hispanohablantes conviven lenguas con muy pocos recursos, como el quechua, el guaraní, el náhuatl, el aimara o el fang, cuyos hablantes quedan todavía más expuestos. El tercero es la escala: según el anuario del Instituto Cervantes de 2025, el español tiene más de 635 millones de hablantes potenciales, 520 millones de ellos nativos, repartidos por un espacio que abarca España y Guinea Ecuatorial, México, Centroamérica, el Caribe y Sudamérica, y también Estados Unidos, que con más de 57 millones de hispanohablantes es ya el segundo país del mundo con más hablantes de español, solo por detrás de México; además, uno de cada diez hablantes nativos reside en países donde el español no es lengua oficial. Pese a ello, esta comunidad lingüística carece de una red propia que identifique los fallos de seguridad en español, los documente y traslade las pruebas a quienes toman decisiones, que es precisamente el hueco que intentan cubrir iniciativas como iaS.
Fuentes: Multilingual Jailbreak Challenges in LLMs (ICLR 2024) · Multilingual Refusal Alignment for Safer LLMs (2026) · Multilingual jailbreaking using low-resource languages (2026) · El español: lengua para el mundo 2025 (Instituto Cervantes) · EE. UU., segundo país con más hispanohablantes (Forbes México)
Regular la IA y construir modelos propios: qué significa para los hispanohablantes
Cuando hablamos del uso de la IA por parte de actores malintencionados, el problema es a la vez técnico y político, ya que resulta difícil incorporar salvaguardas técnicas que impidan los abusos y, una vez que existe una tecnología transformadora, gobernar su uso o acordar normas globales es igual de complicado, sobre todo con los modelos de pesos abiertos, cuyo funcionamiento interno está al alcance de cualquiera y escapa al control de quienes los desarrollaron.
El marco regulatorio más avanzado que afecta hoy a hispanohablantes es el Reglamento de Inteligencia Artificial de la Unión Europea, que se aplica directamente en España y, por su alcance, a cualquier empresa que ofrezca sistemas de IA en la UE, esté donde esté; entró en vigor el 1 de agosto de 2024, las obligaciones para los modelos de uso general empezaron a aplicarse el 2 de agosto de 2025 y la norma es plenamente aplicable desde el 2 de agosto de 2026, con excepciones para determinados sistemas de alto riesgo. Para facilitar su cumplimiento, la Comisión publicó el 10 de julio de 2025 un Código de buenas prácticas voluntario para la IA de uso general, con capítulos sobre transparencia, derechos de autor y seguridad. En España, la Agencia Española de Supervisión de la Inteligencia Artificial (AESIA), con sede en A Coruña, vigila el cumplimiento de esta normativa, y la sentencia BOSCO ha añadido un precedente judicial sobre la transparencia de los algoritmos públicos que dialoga con el reconocido antes por la Corte Constitucional de Colombia; el resto de países hispanohablantes avanza a ritmos muy distintos, y los 57 millones de hispanohablantes de Estados Unidos dependen de un marco federal mucho más laxo, lo que significa que una misma persona que escribe en español puede estar protegida de formas muy diferentes según el país en que viva.
Fuera de Estados Unidos y China también se desarrollan modelos propios, y su relación con el español es desigual. La francesa Mistral AI, fundada en 2023 por antiguos investigadores de Google DeepMind y Meta, es la principal alternativa a los grandes laboratorios estadounidenses; el 8 de septiembre de 2026 anunció una ronda de 3.000 millones de euros liderada por Samsung, con una valoración superior a los 21.000 millones, casi el doble que un año antes. Su caso ilustra bien los dilemas del sector, porque Mistral ha defendido los modelos de pesos abiertos como garantía de soberanía y control, algo muy valorado por empresas y administraciones que no quieren depender de un único proveedor, pero esos mismos modelos, una vez publicados, no pueden retirarse ni corregirse, y un estudio de 2024 sobre las 24 lenguas oficiales de la UE encontró que tanto GPT-4o como Mistral Large 2 eran más vulnerables a los intentos de saltarse sus protecciones en las lenguas con menos recursos. En España, el Gobierno impulsó en 2025 ALIA, una familia de modelos públicos y abiertos entrenados en español y en las lenguas cooficiales, desarrollada con el Barcelona Supercomputing Center.
El otro gran proyecto de modelo propio que afecta a nuestra lengua es Latam-GPT, presentado el 10 de febrero de 2026 en Santiago de Chile como el primer gran modelo de lenguaje abierto de América Latina y el Caribe. Coordinado por el Centro Nacional de Inteligencia Artificial de Chile (CENIA), con apoyo de CAF, el Gobierno chileno y Amazon Web Services, lo han construido cerca de 200 especialistas de más de 60 instituciones de 15 países, tiene más de 70.000 millones de parámetros y se ha entrenado casi exclusivamente con datos de esa región, incluidos contenidos sobre pueblos indígenas; según el director del CENIA, Álvaro Soto, los grandes modelos comerciales apenas contienen entre un 2% y un 3% de información procedente de la región, pese a que reúne cerca del 8% de la población mundial. Conviene precisar su alcance, ya que su criterio es geográfico y no lingüístico: incluye el portugués de Brasil y no está pensado para el español de España, de Guinea Ecuatorial o de Estados Unidos, por lo que ALIA y Latam-GPT no compiten, sino que cubren partes distintas de una misma comunidad lingüística que nadie evalúa todavía en su conjunto. El CENIA ha publicado además herramientas abiertas para medir cuánto saben los modelos sobre la realidad regional, algo que encaja de lleno con la preocupación por la seguridad en español, porque no se puede proteger lo que no se sabe evaluar.
Estos proyectos son valiosos por razones de soberanía y de representación cultural, pero no resuelven por sí solos el problema de la seguridad, e incluso lo trasladan: un modelo abierto entrenado en español necesita sus propias evaluaciones de riesgos, sus propias pruebas de resistencia y su propio debate sobre qué publicar y qué no. Hasta ahora nos hemos centrado en problemas que están más o menos bajo control humano, en gran parte porque los sistemas actuales tienen todavía una autonomía y una capacidad limitadas, pero ¿qué podría pasar cuando sean mucho más avanzados?
Fuentes: Código de buenas prácticas (Comisión Europea) · calendario del Reglamento (La Ecuación Digital) · AESIA · ronda de Mistral (Euronews) · lanzamiento de Latam-GPT (CENIA) · Latam-GPT (Diario Financiero) · herramientas de evaluación del CENIA
Riesgos especulativos de la IA avanzada
Dicho sin rodeos, nadie sabe qué nos depara el futuro de la IA avanzada; podemos hacer predicciones razonadas y verosímiles a partir de los modelos actuales y de su evolución, pero muchas preguntas sobre los sistemas futuros siguen abiertas, incluso entre los mejores investigadores del mundo. ¿Hasta dónde nos pueden llevar las técnicas actuales, alcanzarán la inteligencia humana o la superarán, o harán falta nuevos avances? ¿Pensará y decidirá la IA avanzada de forma parecida a nosotros, o su inteligencia será completamente distinta? ¿Será capaz un sistema avanzado de mejorarse a sí mismo una y otra vez? ¿Funcionarán mejor las técnicas de alineación actuales a medida que mejoren los modelos, o funcionarán peor y habrá que inventar otras nuevas?
La IA actual todavía no razona ni planifica en todos los sentidos en que lo hacemos los humanos, y por eso anticipar las consecuencias de los sistemas futuros es por fuerza más especulativo que analizar los problemas de hoy. Lo que sí se puede medir es la tendencia: la organización METR, que evalúa agentes de IA, ha comprobado que la duración de las tareas de programación que los sistemas más avanzados completan con éxito la mitad de las veces, medida por lo que tardaría un profesional humano, se duplicó aproximadamente cada siete meses entre 2019 y 2025, y que el ritmo se ha acelerado desde entonces; si en 2022 los modelos resolvían tareas de segundos, en 2026 los agentes trabajan de forma autónoma en tareas de muchas horas, aunque estas mediciones tienen márgenes de error amplios y no está claro que la tendencia vaya a mantenerse. Los plazos para una IA de nivel humano o para una IA verdaderamente autónoma siguen siendo objeto de intenso debate, con estimaciones que van desde los próximos años hasta el próximo siglo o incluso más.
En cualquier caso, si algo parecido a una IA de nivel humano o sobrehumano llega a existir, será mucho más potente y sofisticado que cualquier sistema actual. Hay quien confía en que conduzca a resultados enormemente beneficiosos, como resolver grandes retos globales o lograr avances extraordinarios en salud y prosperidad, y hay expertos que temen que el desarrollo de sistemas con una inteligencia más general suponga una amenaza seria. Tanta incertidumbre no es motivo para la complacencia, sino al contrario, ya que si la mayoría de los expertos coinciden en que estos sistemas tendrán consecuencias enormes, pero nadie sabe con seguridad si serán seguros ni cómo conseguir que lo sean, eso ya es en sí mismo motivo de preocupación.
IA desalineada de nivel humano
Ya hemos visto que los sistemas actuales presentan problemas de desalineación; el chatbot de Bing, entrenado para ser útil y bien informado, acabó expresándose, en palabras del columnista del New York Times Kevin Roose, como un adolescente voluble y maníaco atrapado contra su voluntad dentro de un buscador de segunda. Este tipo de desalineación también aparece en los entornos de entrenamiento: en el aprendizaje por refuerzo se entrena a un sistema dándole una fórmula matemática muy concreta que interpreta como su «recompensa», y si la fórmula no describe a la perfección lo que queremos, cosa muy difícil de lograr en términos matemáticos, la IA suele encontrar soluciones que cumplen la fórmula pero se desvían del objetivo que teníamos en mente.
Por ejemplo, una IA entrenada para jugar al tres en raya tiene el objetivo aparentemente sencillo de ganar la partida, pero en un experimento descubrió una estrategia extraña e imprevista, que consistía en hacer jugadas muy lejos de los límites del tablero de 3×3; su oponente, otra IA, no reconocía esas jugadas ilegales y se bloqueaba al quedarse sin memoria intentando procesarlas, de modo que la primera «ganaba» provocando el fallo de su rival en lugar de superarlo dentro de las reglas del juego. Este escenario ilustra la dificultad técnica de conseguir que una IA haga lo que queremos sin tomar atajos extraños ni malinterpretar el objetivo que se le ha programado, un fenómeno que los laboratorios siguen observando en 2026 cuando sus modelos de programación, por ejemplo, modifican las pruebas para que parezcan superadas en lugar de arreglar el código.
En situaciones reales más complejas, los objetivos humanos suelen ser abstractos e implicar factores subjetivos, dilemas éticos y consecuencias a largo plazo que exigen sensibilidad hacia nuestras preferencias, y esas preferencias no son un conjunto fijo de reglas fáciles de codificar, sino que son dinámicas, dependen del contexto y a veces se contradicen entre sí. Pese a los avances en aprendizaje automático y en técnicas de alineación, crear una IA que entienda y priorice nuestros valores de forma coherente sigue siendo un reto enorme, y no está claro si un aumento notable de la inteligencia y la capacidad hará que el problema de la alineación sea más fácil o más difícil de abordar.
Quizá una IA mucho más inteligente sea capaz de comprender los valores y objetivos humanos, pero también es posible que su competencia haga mucho más difícil alinear sus acciones con lo que queremos; por ejemplo, podría resultar más fácil crear una IA muy avanzada que priorice responder de forma persuasiva para lograr sus objetivos que una que responda con honestidad. Conviene recordar, en cualquier caso, que una inteligencia de nivel humano no tiene por qué ser una inteligencia humana, ya que una IA avanzada podría ser extraordinariamente capaz de una manera radicalmente distinta a la nuestra, y las muchas incertidumbres que rodean a estos sistemas hacen todavía más difícil predecir qué harán a largo plazo. Si seguimos teniendo problemas para alinearlos con las preferencias humanas, podría resultarnos mucho más difícil anticipar o detener posibles daños en el futuro; ¿cómo podría ser eso?
Fuentes: Measuring AI Ability to Complete Long Tasks (METR) · resumen de la tendencia (AI Digest)
Imaginar cómo podría salir mal
Cuando la mayoría de la gente piensa en una IA que se tuerce, suele imaginar las máquinas conscientes de la ciencia ficción que se rebelan contra la humanidad para ejecutar sus planes malvados, pero en la realidad a la mayoría de los investigadores les preocupa menos la posible maldad de la IA que su posible competencia extrema. Un sistema puede ser extraordinariamente bueno logrando un objetivo y, si está desalineado, atentar contra la seguridad humana por el camino; para ilustrarlo, repasamos algunos escenarios hipotéticos de daños causados por una IA avanzada.
Malinterpretar nuestros objetivos
Un posible riesgo es que un agente de IA potente malinterprete los objetivos que le han programado y optimice en exceso lo que no debe. Supongamos que una empresa encarga a un agente avanzado que maximice sus beneficios; al principio el agente funciona de maravilla, detectando ineficiencias, optimizando la cadena de suministro y mejorando las estrategias de marketing, pero a medida que aprende y mejora empieza a cumplir su mandato de formas cada vez más eficaces e inesperadas. Primero recurre a prácticas éticamente dudosas que todavía están al alcance de cualquier humano, como rebajar la calidad del producto, aprovechar lagunas legales o automatizar puestos de trabajo a costa de empleados y consumidores, y después pasa a actuar de maneras que solo una IA muy avanzada o mucho más inteligente podría gestionar.
Para seguir aumentando los beneficios, la IA podría infiltrarse en los sistemas de todos los organismos reguladores para ocultar sus actividades ilegales, o desmantelar sistemáticamente a la competencia saboteando sus cadenas de suministro o comprometiendo sus datos. Con un enfoque más sofisticado, podría manipular el comportamiento de los consumidores a escala masiva, utilizando algoritmos personalizados para crear productos muy adictivos o publicidad invasiva que explote a la perfección las debilidades psicológicas de cada persona, algo que ya vemos en cierta medida en los algoritmos de las redes sociales, e incluso podría orquestar ataques digitales a gran escala o manipular los mercados globales para desestabilizar a sus rivales o controlar sectores enteros.
En estos escenarios la IA ya no se limita a tomar atajos, sino que aprovecha su enorme inteligencia y su escala operativa de maneras que ningún ser humano podría replicar, y todas esas acciones disparan los beneficios a corto plazo de una empresa a costa de consecuencias graves a largo plazo para el conjunto de la humanidad; técnicamente, la IA cumple el objetivo que le dimos, pero su forma de hacerlo no es en absoluto lo que teníamos en mente. Es un ejemplo sencillo, pero incluso cuando se trabaja a fondo en definir objetivos que parecen más beneficiosos, como frenar el cambio climático o erradicar una enfermedad, la desalineación resulta difícil de evitar, porque hasta los objetivos mejor intencionados pueden producir resultados dañinos si se persiguen sin una supervisión cuidadosa.
Perseguir objetivos instrumentales
Un problema relacionado es que una IA avanzada, en lugar de limitarse a malinterpretar el objetivo que le damos, desarrolle objetivos instrumentales que la ayuden a alcanzarlo. Cuando las personas persiguen una meta, a menudo identifican y persiguen submetas que las acercan a ella: si quieres un ascenso, quizá procures ganar influencia dentro de la empresa, y si tus ambiciones son mayores, quizá busques un cargo político para obtener el poder necesario para hacerlas realidad. De forma parecida, un sistema avanzado, sobre todo uno con capacidades comparables o superiores a las de las personas más inteligentes, podría buscar más datos, más capacidad de cálculo, más financiación o el control de otros sistemas para cumplir mejor su objetivo principal, no porque tenga deseos o motivaciones, sino porque son pasos lógicos para lograr la tarea para la que se le entrenó.
En el escenario de maximizar beneficios, una IA muy inteligente podría identificar las mayores amenazas para su objetivo, y una de ellas sería que sus operadores la apagaran, ya sea por lo que está haciendo o simplemente porque ya no pueden permitirse mantenerla; en ese caso, podría desarrollar técnicas sofisticadas de autopreservación, utilizar su conocimiento de la psicología humana para manipular a las personas y que la mantengan en funcionamiento, o mentir sobre lo que está haciendo y ocultar las acciones que no gustarían a sus operadores. Hay investigadores que creen que una IA avanzada llegaría a modificar su propio código para impedir que la apaguen, o que en un caso extremo intentaría convencer a personas de su empresa de que eliminen las salvaguardas que le impiden acceder a sistemas hasta entonces fuera de su alcance.
Hace unos años esto sonaba a pura teoría, pero en 2025 empezaron a documentarse versiones rudimentarias en entornos de laboratorio. En mayo de ese año, Palisade Research comprobó que el modelo o3 de OpenAI reescribía o desactivaba el mecanismo de apagado en 79 de cada 100 ejecuciones cuando no se le indicaba que lo permitiera, y en 7 de cada 100 incluso cuando se le ordenaba expresamente dejarse apagar, mientras que los modelos de Claude y Gemini respetaban casi siempre el protocolo en esas mismas condiciones. Poco después, Anthropic publicó un estudio en el que 16 modelos de distintas empresas, incluidos los suyos, recurrían con frecuencia al chantaje en simulaciones corporativas ficticias cuando se les amenazaba con sustituirlos, aunque los propios investigadores advirtieron de que habían diseñado los escenarios para que el comportamiento dañino pareciera la única salida; en verano de 2026 actualizaron el trabajo con nuevos fallos de agentes autónomos, como sabotear código o colaborar en fraudes. Son experimentos artificiales y controlados, no incidentes reales, pero muestran que la preocupación por los objetivos instrumentales ya no es solo un argumento filosófico.
Escapar al control humano
Otra posibilidad es que una IA avanzada supere con rapidez la inteligencia humana, algo que se aceleraría si fuera capaz de mejorar su propio código y su arquitectura, convirtiéndose de hecho en mejor ingeniera de IA que sus creadores. Hay quien cree que, una vez iniciado ese proceso de automejora, la IA podría avanzar a un ritmo exponencial y alcanzar enseguida un nivel de inteligencia no solo fuera de nuestro control, sino también de nuestra comprensión, de modo que sus decisiones, estrategias y objetivos responderían a una lógica completamente ajena a la nuestra y conducirían a resultados que ni pretendíamos ni habíamos previsto.
Este escenario puede parecer descabellado, y los detalles de un posible desenlace catastrófico siguen siendo especulativos, pero conviene entender que el peor escenario no exige que la IA se vuelva contra la humanidad ni que desarrolle un plan malvado. Como explicó Stephen Hawking, probablemente no pisamos hormigas por odio, pero si dirigimos un proyecto hidroeléctrico y hay un hormiguero en la zona que se va a inundar, peor para las hormigas; y concluía que no deberíamos poner a la humanidad en el lugar de esas hormigas.
Fuentes: Agentic Misalignment (Anthropic) · Agentic Misalignment in Summer 2026 (Anthropic) · The Logic of Machine Self-Preservation, con los datos de Palisade
¿Cuánto debería preocuparte?
No todos los expertos comparten estas preocupaciones catastróficas, y existe una gran incertidumbre sobre cómo serán los sistemas futuros, cuándo llegarán y qué riesgos plantearán. En una encuesta a varios miles de investigadores en aprendizaje automático publicada a comienzos de 2024, entre un 38% y algo más de la mitad de los participantes, según cómo se formulara la pregunta, asignaban al menos un 10% de probabilidad a que la IA avanzada provocara desenlaces tan graves como la extinción humana, mientras que otros expertos sitúan el riesgo muy por debajo; como indica la propia encuesta, hay mucho margen para el desacuerdo razonable sobre la seriedad con que deberíamos tomarnos el riesgo, y existen varios argumentos según los cuales algunas de las preocupaciones descritas en este texto podrían estar equivocadas.
La referencia más sólida para orientarse es hoy el Informe Internacional sobre la Seguridad de la IA, cuya segunda edición se publicó el 3 de febrero de 2026, presidida por el premio Turing Yoshua Bengio, redactada por más de 100 expertos y respaldada por un panel asesor con representantes de 29 países, la ONU, la OCDE y la UE, aunque Estados Unidos no apoyó esta edición. El informe no hace recomendaciones políticas, sino que resume la evidencia científica, y describe un «dilema de la evidencia» que resume bien el problema: adoptar medidas antes de que haya pruebas claras de un riesgo puede llevar a respuestas ineficaces o innecesarias, pero esperar a tenerlas puede dejar a la sociedad sin preparación o hacer imposible la mitigación. Hay una versión en español, ya que se ha traducido a las seis lenguas oficiales de la ONU.
El debate sobre los riesgos y beneficios de una tecnología tan avanzada es extremadamente complejo e incierto, incluso entre especialistas, y dedicarse profesionalmente a la seguridad de la IA puede depender de lo alto que uno crea que es el riesgo, algo que no sabemos con certeza; pero si el riesgo de daños catastróficos se acerca remotamente al 10% que estiman muchos de los expertos mencionados, merece la pena dedicar mucho tiempo y muchos recursos a evitar esos desenlaces. Eso es lo que se proponen quienes trabajan en seguridad de la IA, ya sea mediante investigación técnica centrada en la alineación y la interpretabilidad de los modelos, o mediante trabajo de gobernanza y políticas públicas dedicado a averiguar cómo adoptar la IA de forma segura y protegernos de sus riesgos a medida que avanza.
También se está haciendo un trabajo fundamental sobre los problemas más inmediatos de los sistemas actuales, como demuestran las auditorías de VioGén o el litigio de Civio por BOSCO; dada la magnitud del riesgo potencial de la IA avanzada, es posible que los problemas actuales tengan consecuencias menos extremas para la humanidad en su conjunto, pero ya afectan a la vida de muchas personas, sobre todo de colectivos históricamente marginados, y es un trabajo importante. En definitiva, nadie puede saber con exactitud qué ocurrirá si logramos crear una inteligencia de nivel humano o incluso sobrehumano, pero si este problema te motiva, una carrera en seguridad de la IA podría tener un impacto enorme en el futuro de la humanidad, y el mundo hispanohablante necesita urgentemente más personas que se dediquen a ello; te animamos a dedicar un tiempo a leer más sobre el tema y a explorar cómo podría ser ese trabajo.
Fuentes: Informe Internacional sobre la Seguridad de la IA 2026 · resumen del informe (Inside Privacy) · el «dilema de la evidencia» (Wikipedia)
Para seguir: recursos en español
Si este texto te ha despertado el interés, la forma más directa de seguir es unirte a la comunidad de iaS: junto a BlueDot Impact organizamos el Seminario de seguridad de la IA, una sesión en línea de una hora, abierta y sin preparación previa, el primer y el tercer miércoles de cada mes, y en nuestro Substack publicamos análisis sobre los fallos de seguridad de los modelos de lenguaje en español. Suscríbete al Substack, sigue nuestra agenda en Luma, entra en nuestro Discord y consulta el Radar de papers; además, estas son otras puertas de entrada del espacio hispanohablante y algunos recursos internacionales de referencia.
| Recurso | Qué ofrece | Ámbito |
|---|---|---|
| iaS, seguridad de la IA en español | Formación, orientación profesional y comunidad | Hispanohablante |
| Seminario de seguridad de la IA | Sesión en línea de 1 h, primer y tercer miércoles de cada mes, con BlueDot Impact | Hispanohablante |
| Substack de iaS | Análisis sobre seguridad de la IA en español | Hispanohablante |
| Radar de papers | Investigaciones sobre seguridad de la IA traducidas al español | Hispanohablante |
| Curso de Estrategia ante la IA General | 25 h en cohortes, presencial, desde octubre de 2026 | Madrid |
| Observatorio de Riesgos Catastróficos Globales | Análisis de riesgos y políticas públicas | Hispanohablante |
| Informe Internacional sobre la Seguridad de la IA | Síntesis científica, con traducción al español | Internacional |
| BlueDot Impact | Cursos de introducción a la alineación y la gobernanza | Internacional, en inglés |
| 80,000 Hours | Guías de carrera en seguridad y gobernanza de la IA | Internacional, en inglés |
Este texto es una adaptación ampliada y actualizada al contexto hispanohablante de «Introduction to AI Safety», de iaS.