Web scraping, IA generativa e interés legítimo

Un desafío para la Ley sobre Protección de Datos Personales

LUCAS MACCLURE

1

Ley Nº 19.628 reformada por la Ley Nº 21.719 de 2024 (entrada diferida para el 1 de diciembre de 2025). Para una introducción a esta ley, ver MacClure, Lucas, Lucas Sierra, y Pablo Fuenzalida, “Una introducción a la nueva Ley sobre Protección de Datos Personales y su relevancia para el Derecho de la Competencia”, CentroCompetencia, noviembre de 2024, https://centrocompetencia.com/wp-content/uploads/2024/11/Investigacion-Dialogo-Datos-Personales.pdf [en adelante MacClure et. al., «Una introducción a la nueva Ley sobre Protección de Datos Personales»].

INTRODUCCIÓN

Cuando entre en vigencia la Ley sobre Protección de Datos Personales (LPDP)1, su autoridad de control –la Agencia de Protección de Datos Personales– se enfrentará a una pregunta urgente: ¿las empresas de inteligencia artificial generativa (IA) como OpenAI o Google cumplen con la ley cuando recolectan datos personales disponibles en Internet para entrenar a ChatGPT o Gemini? Este es el problema de la legalidad, bajo la LPDP, del web scraping de la IA generativa.

El fin de este breve trabajo es contribuir a enmarcar ese problema. Es decir, identificar antecedentes, preguntas e hipótesis que sean relevantes para interpretar y aplicar la ley a casos sobre web scraping de la IA bajo la LPDP. En particular, aquí me enfoco en su legalidad desde la perspectiva de las reglas sobre las fuentes de licitud –o condiciones habilitantes– del tratamiento de datos personales. En esta materia, como mostraré, es muy importante la fuente del “interés legítimo”2. La LPDP establece que una base de licitud es “la satisfacción de intereses legítimos del responsable o de un tercero” (art. 13 inc. 1 letra d). Para entender si se cumplen esta fuente de licitud es útil considerar la experiencia europea. Sus autoridades ya están analizando el web scraping bajo el Reglamento General de Protección de Datos Personales (GDPR), una regulación muy similar a la chilena. Esta experiencia europea será considerada aquí para sugerir cómo se podría examinar este problema en Chile.

Este trabajo se divide en cuatro partes. La Parte 1 conceptualiza el web scraping de la IA y muestra que esta actividad es un tratamiento de datos personales en el sentido de la LPDP. La Parte 2 describe cómo las autoridades de control de la UE están investigando a empresas como ChatGPT en relación a esa actividad y a la luz de la regulación sobre protección de datos personales. La Parte 3 empieza a examinar las potenciales fuentes de licitud de ese web scraping. Se muestra que la justificación más plausible de esa actividad es la fuente del «interés legítimo». La Parte 4 aborda la pregunta de si esa fuente de licitud es efectivamente capaz de justificar el web scraping de la IA, a la luz de varios análisis de autoridades de la UE y de su academia. Para ello se analizan tres condiciones, tests o «pasos» del interés legítimo. Una hipótesis plausible, según la experiencia europea, es que el web scraping de la IA, tal como lo conocemos, no es capaz de cumplir con al menos dos de los tests. Asimismo, como enfatiza la Conclusión, la experiencia europea sugiere que para evaluar el web scraping de la IA desde la perspectiva de esa fuente de licitud la Agencia deberá realizar un profundo análisis jurídico, constitucional y ético.

2

Para análisis globales de la IA generativa bajo la GDPR, ver Ruschemeier, Hannah, “Generative AI and Data Protection”, Cambridge Forum on AI: Law and Governance 1 (enero de 2025): e6, pp. 1-16 [en adelante Ruschemeier, “Generative AI and Data Protection”]; y European Data Protection Board, Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models, 17 diciembre 2024, https://www.edpb.europa.eu/our-work-tools/our-documents/opinion-board-art-64/opinion-282024-certain-data-protection-aspects_en [en adelante EDPB, Opinion 28/2024].

3

EDPB, Opinion 28/2024, p. 11.

5

Como ha explicado la profesora Hannah Ruschemeir, “Inevitablemente, esto suele incluir datos personales como nombres, fechas de nacimiento u otra información de identificación». Y algunos de los datos recopilados incluyen “detalles indirectos que pueden llevar a la identificación de una persona a través de información adicional” (Ruschemeier, “Generative AI and Data Protection”, p. 5, traducción del autor). OpenAI ha reconocido que su web scraping recolecta datos personales: “A significant portion of online content involves information about people, so our training data may incidentally include personal information.” OpenAI, “How ChatGPT and Our Foundation Models Are Developed”, https://help.openai.com/en/articles/7842364-how-chatgpt-and-our-foundation-models-are-developed.

1. EL WEB SCRAPING DE LA IA COMO TRATAMIENTO DE DATOS PERSONALES

El web scraping permite la recolección automatizada de información desde diversas fuentes abiertas en Internet, por ejemplo, «sitios de noticias, redes sociales, discusiones en foros y websites personales».3 Empresas de IA generativa lo utilizan para crear bases de datos que sirvan para entrenar sus modelos.4 Inevitablemente, este acopio incluye datos personales –nombres, información asociada a ellos, etc.–.5 En este sentido, las empresas de IA realizan un tratamiento de datos personales en calidad de responsables cuando realizan web scraping.

Este web scrapping es masivo. Alcanza los datos personales de miles y potencialmente millones de personas que residen en Chile, además de millones de personas a nivel global. Al mismo tiempo, este tratamiento de datos es esencial para el desarrollo de los modelos de IA generativa. Indudablemente, es un tratamiento muy importante para todos los actores involucrados. Y uno que será regulado por la LPDP cuando ella entre en vigencia.

4

OpenAI, “Privacy Policy”, , https://openai.com/policies/row-privacy-policy/.

7

Ver Agencia Española de Protección de Datos, “La AEPD inicia de oficio actuaciones de investigación a OpenAI, propietaria de ChatGPT”, abril de 2023, https://www.aepd.es/prensa-y-comunicacion/notas-de-prensa/aepd-inicia-de-oficio-actuaciones-de-investigacion-a-openai.

9

EDPB, Opinion 28/2024.

2. CÓMO LAS AUTORIDADES DE PROTECCIÓN DE DATOS PERSONALES DE LA UE ESTÁN INVESTIGANDO EL WEB SCRAPING DE LA IA

Varias autoridades europeas han empezado a examinar la legalidad del web scraping de las empresas de IA bajo el GDPR. Aplicando esta regulación, en el año 2023 la autoridad de protección de datos personales de Italia –el Garante per la Protezione dei Dati Personali– ordenó la suspensión del despliegue de ChatGPT en ese país. Posteriormente, la autoridad italiana impuso sanciones administrativas, cuestionando la fuente de legalidad invocada por OpenAI para ciertos tratamientos de datos personales como el web scraping.6 OpenAI también ha sido objeto de investigaciones en España, Alemania y otros países europeos.7

Una investigación en curso muy importante está ocurriendo en Irlanda. El 15 de febrero de 2024, la Data Protection Commission de ese país concentró competencias sobre ChatGPT respecto de tratamientos ocurridos a partir de esa fecha.8 Y la Commission está investigando los tratamientos de datos personales de OpenAI. Será importante prestar atención a una decisión de esa agencia.

Además, el órgano de la UE con funciones de coordinación y cooperación respecto de la aplicación del GDPR –el Comité Europeo de Protección de Datos– ha producido informes sobre la IA generativa y los datos personales que utiliza. El Comité creó un grupo de trabajo enfocado en ChatGPT que produjo un informe el 23 de mayo de 2024.9 A fines del mismo año, el Comité publicó una opinión sobre los aspectos legales de los modelos de IA bajo el GDPR.10

Esta experiencia europea también es útil para evaluar el web scraping de la IA en el contexto chileno. Veamos.

6

Garante per la Protezione dei Dati Personali, “Comunicato stampa – ChatGPT, il Garante privacy chiude l’istruttoria. OpenAI dovrà realizzare una campagna informativa di sei mesi e pagare una sanzione di 15 milioni di euro”, diciembre de 2024, https://www.garanteprivacy.it:443/home/docweb/-/docweb-display/docweb/10085432.

8

Aunque ChatGPT ya había empezado a operar en la UE en noviembre de 2022, la compañía se estableció oficialmente en un país del territorio de la UE (en Irlanda) el 15 de febrero de 2024. Este establecimiento gatilló la concentración de competencias en la autoridad de control irlandesa según lo establecido en el art. 56.1 del GDPR.

10

European Data Protection Board, Report of the work undertaken by the ChatGPT Taskforce, 23 mayo, 2024, https://www.edpb.europa.eu/our-work-tools/our-documents/other/report-work-undertaken-chatgpt-taskforce_en.

11

Para un resumen de las fuentes de licitud y del régimen de sanciones de la LPDP, ver MacClure et. al., » Una introducción a la nueva Ley sobre Protección de Datos Personales», pp. 37-42 y 60-65, respectivamente.

3. ¿CUÁL ES LA FUENTE DE LICITUD EN JUEGO?

La LPDP, como su símil europeo, exige que todo tratamiento de datos personales cumpla con al menos una de las condiciones habilitantes del tratamiento conocidas como “fuentes de licitud” (LPDP) o “base del tratamiento” (GDPR). En Chile, un responsable que incumple esta regulación se expone a sanciones de multas y, en casos extremos, a la suspensión de sus actividades.11

En el contexto del web scraping a gran escala la mayoría de las bases resultan impracticables: el consentimiento individualizado es inviable; el cumplimiento de obligaciones legales o contractuales rara vez calza; y la defensa de derechos en juicio tampoco aplica al acopio sistemático de datos para entrenamiento de modelos. En ese escenario, lo que queda es que las empresas de IA invoquen la fuente del “interés legítimo”. Así lo ha hecho, por ejemplo, OpenAI.12

Al respecto, la LPDP dice que el tratamiento de datos personales está permitido cuando “sea necesario para la satisfacción de intereses legítimos del responsable o de un tercero, siempre que con ello no se afecten los derechos y libertades del titular” (art. 13 inc. 1 letra d). ¿Cómo se debería analizar el cumplimiento de esta fuente de licitud en el contexto del web scraping de la IA?

12

Ver OpenAI, “How ChatGPT and Our Foundation Models Are Developed”, https://help.openai.com/en/articles/7842364-how-chatgpt-and-our-foundation-models-are-developed, (“We base our collection and use of personal information that is included in training information on legitimate interests under privacy laws like the GDPR”).

13

Art. 6.1.f del GDPR.

15

EDPB, Opinion 28/2024, p. 3.

17

Ver Emma Roth, “The New York Times Is Suing OpenAI and Microsoft for Copyright Infringement”, The Verge, 27 de diciembre de 2023, https://www.theverge.com/2023/12/27/24016212/new-york-times-openai-microsoft-lawsuit-copyright-infringement.

19

Ver EDPB, Opinion 28/2024, p. 22.

21

Sin embargo, al abordar la tercera condición del interés legítimo (que se aborda más abajo), Ruschemeier agrega este matiz: “no es absolutamente necesario recopilar datos a una escala que abarque casi todos los recursos de acceso público en internet para desarrollar modelos generativos: los conjuntos de datos pueden generarse de otras maneras, como a través de donaciones de datos, soluciones eficaces de consentimiento o la recopilación de datos por parte del propio responsable del tratamiento. No obstante, ninguna de estas opciones alternativas podría proporcionar la amplitud de datos requerida”. Ruschemeier, “Generative AI and Data Protection”, p. 7, traducción del autor.

23

Ver ibid., p. 24.

25

Ruschemeier, “Generative AI and Data Protection”, p. 8

27

Ver EDPB, Opinion 28/2024, p. 25

4. EL TRIPLE TEST DEL INTERÉS LEGÍTIMO Y EL WEB SCRAPING DE LA IA

A partir de una regla muy similar a la de la LPDP sobre el interés legítimo,13 las autoridades europeas han identificado tres condiciones, tests o pasos que un responsable debe satisfacer para cumplir con esta fuente de licitud:

(1) que exista un interés legítimo del responsable o de un tercero;
(2) que el tratamiento sea necesario para alcanzar ese interés;
(3) que los derechos fundamentales y libertades de los titulares no prevalezcan por sobre el interés legítimo invocado.14

4.1. Primera condición: existencia del interés legítimo

Según el Comité Europeo de Protección de Datos, un interés es legítimo si es “(1) legal, (b) clara y precisamente articulado, y (c) real y presente (i.e., no especulativo)”.15

A primera vista, el desarrollo y mejora de servicios de IA como ChatGPT puede calificarse como un interés económico de OpenAI. Este interés es tutelado por la libertad para desarrollar cualquier actividad económica del art. 19 Nº 21 de la Constitución. Además, es posible que OpenAI pueda invocar otros intereses, incluyendo el bienestar de los usuarios.16

Sin embargo, el requisito de la licitud del interés no se satisface si, al perseguirlo, el responsable incurre en infracciones a otras reglas legales. Estas reglas pueden incluir otras de la misma LPDP –distintas a aquellas sobre las fuentes de licitud– así como las de otras leyes. Una regulación importante es aquella sobre la propiedad intelectual, especialmente si se considera que el diario norteamericano The New York Times demandó a OpenAI por infracción de derechos de autor supestamente cometida, precisamente, mediante el web scraping.17 Por estas razones, la profesora alemana Hannah Ruschemeier ha sugerido que estas empresas no pasan el primer test.18 Aquí surge una primera zona de duda que la Agencia chilena deberá abordar.

4.2. Segunda condición: necesidad del tratamiento

La segunda condición del interés legítimo es que el tratamiento sea necesario para alcanzar el interés invocado, en el sentido de que no existan medios menos intrusivos para conseguir la misma finalidad.19 En el contexto de los LLMs, se podría sostener que el entrenamiento efectivamente requiere grandes corpus de información, y que la anonimización total no es suficiente para lograr los resultados esperados.20 En principio, pareciera que esta condición se cumple.21

4.3. Tercera condición: ponderación con derechos y libertades

La tercera condición del interés legítimo —y probablemente el más desafiante— es la ponderación entre, por un lado, el interés legítimo del responsable o terceros y, por otro, los «derechos y libertades del titular”. En la UE se ha entendido que esta última expresión incluye los derechos fundamentales. Así, la evaluación de esta fuente de licitud se conecta con el derecho constitucional. El responsable debe demostrar que esos derechos no son preponderantes sobre los intereses legítimos invocados en el caso bajo análisis. En otras palabras, debe justificar por qué esos intereses legítimos pesan más que los derechos y libertades afectados por el tratamiento. Esta es una tarea desafiante para las empresas de IA en relación al web scraping.

El Comité Europeo de Protección de Datos ha subrayado que el desarrollo e implementación de modelos de IA puede generar riesgos severos para la vida privada y la protección de datos, así como para la seguridad, la reputación y la integridad frente a fraudes o suplantaciones.22

Además, el scraping masivo y la subsequente publicación de datos personales en aplicaciones como ChatGPT pueden afectar la libertad de expresión. Es posible que las personas experimenten una sensación de vigilancia o exposición permanente sobre su actividad en línea, lo cual las lleve a ser más cautelosas sobre lo que escriben en foros y redes sociales. En el extremo, el peligro es que las personas se autocensuren por miedo a que lo que publican en internet sea recolectado mediante el web scraping, para que a continuación la IA presente esta información de manera agregada a usuarios.23

El Comité ha señalado que se debería considerar cuál es la expectativa razonable de privacidad de los titulares.24 Al respecto, la profesora Hannah Ruschemeie afirma que “el usuario típico de Internet no espera ni tiene la intención de que sus datos sean utilizados como material de entrenamiento de los LLMs para lograr el beneficio económico de otras personas”.25 Con mayor razón, ha dicho, la legítima expectativa de privacidad cubre “los posteos de hace décadas o eliminados”.26

Por otro lado, el Comité ha sugerido que el web scraping puede tener efectos positivos en relación a ciertos derechos fundamentales, por ejemplo, el acceso a la información mediante ChatGPT.27 Y que hay otros factores que también deben ser considerados, tal como las medidas de mitigación de las empresas de IA.28

Nuevamente, se abre un espacio de incertidumbre que deberá ser abordado por la Agencia.

14

Ver en general Pablo Contreras Vásquez et al., Compliance y protección de datos personales: Explicación de la nueva ley No 21.719 (Santiago: Der ediciones, 2024), pp. 72-74. Para un análisis detallado del interés legítimo en el derecho europeo, ver Pablo Contreras y Pablo Trigo, “Interés legítimo y tratamiento de datos personales: Antecedentes comparados y regulación en Chile”, Revista Chilena de Derecho y Tecnología 8, no 1 (2019): 69–106.

16

Según el Garante italiano, “Para entrenar sus modelos, OpenAI se basó en sus intereses legítimos, así como en los de terceros y de la sociedad en general, con el fin de construir una inteligencia artificial segura y beneficiosa para toda la humanidad, conforme al artículo 6, numeral 1, letra f) del RGPD. OpenAI también invocó la base jurídica del interés legítimo cuando el tratamiento de los datos personales de los usuarios era necesario (i) para prevenir fraudes, actividades delictivas o abusos de sus servicios y para proteger la seguridad de sus sistemas y servicios, o (ii) para proteger los derechos, la privacidad, la seguridad o la propiedad de OpenAI o de sus usuarios, filiales o terceros.” Garante per la Protezione dei Dati Personali, “Provvedimento del 2 novembre 2024 [10085455]”, 2 de noviembre de 2024, https://www.consultingpb.com/wp-content/uploads/2024/12/GarantePrivacy-10085455-1.5.pdf (traducción al español del autor basada en la versión en inglés disponible en https://dpo-india.com/Resources/Fines_and_Penalties_by_DPAs_on_Privacy_Violations/Italy-DPA/Italian-DPA-vs-OpenAI-02.11.24.pdf?utm_source=chatgpt.com, p. 19).

18

Ver Ruschemeier, “Generative AI and Data Protection”, p. 8.

20

Ver Ruschemeier, “Generative AI and Data Protection”, p. 7.

22

Ver EDPB, Opinion 28/2024, p. 24.

24

Ver ibid., Opinion 28/2024, pp. 26-28.

26

Ibid., p. 8.

28

Ver ibid., p. 28.

29

Sobre la privacidad en el derecho constitucional chileno, ver Rodolfo Figueroa García-Huidobro, Privacidad (Santiago: Editorial Universidad Diego Portales, 2014); sobre el derecho a la protección de datos personales, Pablo Contreras, “El derecho a la protección de datos personales y el reconocimiento de la autodeterminación informativa en la Constitución chilena”, Estudios constitucionales 18, no 2 (2020): 87–120; sobre la filosofía de la privacidad, ver Carissa Véliz, The Ethics of Privacy and Surveillance (Oxford University Press, 2024).

CONCLUSIÓN: LA NECESIDAD DE UN ANÁLISIS CONSTITUCIONAL Y ÉTICO DEL WEB SCRAPING DE LA IA, Y PRÓXIMOS PASOS

Analizar la fuente de legalidad de la recolección de datos personales realizada por empresas de IA será un desafío para la Agencia y en general quienes nos dedicamos a la protección de datos personales en Chile. La experiencia europea ayudar a enmarcar el problema y subraya que es un desafío de alta complejidad.

El problema se concentra en examinar la fuente del interés legítimo, considerando sus tres condiciones: existencia del interés, necesidad del tratamiento para alcanzarlo, y preponderancia del mismo por sobre los derechos fundamentales de los titulares.

Llevar a cabo este análisis será una tarea exigente: Requerirá combinar la argumentación basada en el texto de la ley con consideraciones de naturaleza constitucional y moral. Este análisis en base a la Constitución y la ética será necesario para identificar intereses individuales y sociales asociados a la privacidad, la vigilancia y la IA en el contexto del web scraping. Lo cual, a su vez, permitirá responder cuáles son los «interéses legítimos» y «derechos y libertades» en juego, y cómo ponderarlos. La tarea de la Agencia será, para bien o para mal, análoga a la que realiza el Tribunal Constitucional cuando evalúa normas a la luz de derechos fundamentales y otros intereses constitucionalmente relevantes. Por lo tanto, será importante considerar fuentes del derecho constitucional chileno y la ética, entre otras.29

También será útil que la Agencia considere la experiencia europea, a la luz de antecedentes como las que han sido abordados en el presente trabajo. En el futuro cercano, se debe considerar la decisión que tomará la autoridad de control irlandesa respecto de OpenAI. Como ya se advirtió, la Commission debería dictar pronto una resolución sobre la legalidad del web scraping y otros tratatamientos de datos personales de esa empresa. Esta agencia tendrá una ventaja sobre otras: acceso a las decisiones previas de autoridades nacionales, a varios informes del Comité Europeo de Protección de Datos Personales, y a trabajos de académicos. Además, ese foro puede ser una oportunidad para que OpenAI y organizaciones de la sociedad civil presenten nuevos antecedentes y argumentos. Es un hito al cual habrá que prestar atención.

× 1 Ley Nº 19.628 reformada por la Ley Nº 21.719 de 2024 (entrada diferida para el 1 de diciembre de 2025). Para una introducción a esta ley, ver MacClure, Lucas, Lucas Sierra, y Pablo Fuenzalida, “Una introducción a la nueva Ley sobre Protección de Datos Personales y su relevancia para el Derecho de la Competencia”, CentroCompetencia, noviembre de 2024, https://centrocompetencia.com/wp-content/uploads/2024/11/Investigacion-Dialogo-Datos-Personales.pdf [en adelante MacClure et. al., «Una introducción a la nueva Ley sobre Protección de Datos Personales»].
× 2 Para análisis globales de la IA generativa bajo la GDPR, ver Ruschemeier, Hannah, “Generative AI and Data Protection”, Cambridge Forum on AI: Law and Governance 1 (enero de 2025): e6, pp. 1-16 [en adelante Ruschemeier, “Generative AI and Data Protection”]; y European Data Protection Board, Opinion 28/2024 on certain data protection aspects related to the processing of personal data in the context of AI models, 17 diciembre 2024, https://www.edpb.europa.eu/our-work-tools/our-documents/opinion-board-art-64/opinion-282024-certain-data-protection-aspects_en [en adelante EDPB, Opinion 28/2024].
× 3 EDPB, Opinion 28/2024, p. 11.
× 4 OpenAI, “Privacy Policy”, , https://openai.com/policies/row-privacy-policy/.
× 5 Como ha explicado la profesora Hannah Ruschemeir, “Inevitablemente, esto suele incluir datos personales como nombres, fechas de nacimiento u otra información de identificación». Y algunos de los datos recopilados incluyen “detalles indirectos que pueden llevar a la identificación de una persona a través de información adicional” (Ruschemeier, “Generative AI and Data Protection”, p. 5, traducción del autor). OpenAI ha reconocido que su web scraping recolecta datos personales: “A significant portion of online content involves information about people, so our training data may incidentally include personal information.” OpenAI, “How ChatGPT and Our Foundation Models Are Developed”, https://help.openai.com/en/articles/7842364-how-chatgpt-and-our-foundation-models-are-developed.
× 6 Garante per la Protezione dei Dati Personali, “Comunicato stampa – ChatGPT, il Garante privacy chiude l’istruttoria. OpenAI dovrà realizzare una campagna informativa di sei mesi e pagare una sanzione di 15 milioni di euro”, diciembre de 2024, https://www.garanteprivacy.it:443/home/docweb/-/docweb-display/docweb/10085432.
× 7 Ver Agencia Española de Protección de Datos, “La AEPD inicia de oficio actuaciones de investigación a OpenAI, propietaria de ChatGPT”, abril de 2023, https://www.aepd.es/prensa-y-comunicacion/notas-de-prensa/aepd-inicia-de-oficio-actuaciones-de-investigacion-a-openai.
× 8 Aunque ChatGPT ya había empezado a operar en la UE en noviembre de 2022, la compañía se estableció oficialmente en un país del territorio de la UE (en Irlanda) el 15 de febrero de 2024. Este establecimiento gatilló la concentración de competencias en la autoridad de control irlandesa según lo establecido en el art. 56.1 del GDPR.
× 9 EDPB, Opinion 28/2024.
× 10 European Data Protection Board, Report of the work undertaken by the ChatGPT Taskforce, 23 mayo, 2024, https://www.edpb.europa.eu/our-work-tools/our-documents/other/report-work-undertaken-chatgpt-taskforce_en.
× 11 Para un resumen de las fuentes de licitud y del régimen de sanciones de la LPDP, ver MacClure et. al., » Una introducción a la nueva Ley sobre Protección de Datos Personales», pp. 37-42 y 60-65, respectivamente.
× 12 Ver OpenAI, “How ChatGPT and Our Foundation Models Are Developed”, https://help.openai.com/en/articles/7842364-how-chatgpt-and-our-foundation-models-are-developed, (“We base our collection and use of personal information that is included in training information on legitimate interests under privacy laws like the GDPR”).
× 13 Art. 6.1.f del GDPR.
× 14 Ver en general Pablo Contreras Vásquez et al., Compliance y protección de datos personales: Explicación de la nueva ley No 21.719 (Santiago: Der ediciones, 2024), pp. 72-74. Para un análisis detallado del interés legítimo en el derecho europeo, ver Pablo Contreras y Pablo Trigo, “Interés legítimo y tratamiento de datos personales: Antecedentes comparados y regulación en Chile”, Revista Chilena de Derecho y Tecnología 8, no 1 (2019): 69–106.
× 15 EDPB, Opinion 28/2024, p. 3.
× 16 Según el Garante italiano, “Para entrenar sus modelos, OpenAI se basó en sus intereses legítimos, así como en los de terceros y de la sociedad en general, con el fin de construir una inteligencia artificial segura y beneficiosa para toda la humanidad, conforme al artículo 6, numeral 1, letra f) del RGPD. OpenAI también invocó la base jurídica del interés legítimo cuando el tratamiento de los datos personales de los usuarios era necesario (i) para prevenir fraudes, actividades delictivas o abusos de sus servicios y para proteger la seguridad de sus sistemas y servicios, o (ii) para proteger los derechos, la privacidad, la seguridad o la propiedad de OpenAI o de sus usuarios, filiales o terceros.” Garante per la Protezione dei Dati Personali, “Provvedimento del 2 novembre 2024 [10085455]”, 2 de noviembre de 2024, https://www.consultingpb.com/wp-content/uploads/2024/12/GarantePrivacy-10085455-1.5.pdf (traducción al español del autor basada en la versión en inglés disponible en https://dpo-india.com/Resources/Fines_and_Penalties_by_DPAs_on_Privacy_Violations/Italy-DPA/Italian-DPA-vs-OpenAI-02.11.24.pdf?utm_source=chatgpt.com, p. 19).
× 17 Ver Emma Roth, “The New York Times Is Suing OpenAI and Microsoft for Copyright Infringement”, The Verge, 27 de diciembre de 2023, https://www.theverge.com/2023/12/27/24016212/new-york-times-openai-microsoft-lawsuit-copyright-infringement.
× 18 Ver Ruschemeier, “Generative AI and Data Protection”, p. 8.
× 19 Ver EDPB, Opinion 28/2024, p. 22.
× 20 Ver Ruschemeier, “Generative AI and Data Protection”, p. 7.
× 21 Sin embargo, al abordar la tercera condición del interés legítimo (que se aborda más abajo), Ruschemeier agrega este matiz: “no es absolutamente necesario recopilar datos a una escala que abarque casi todos los recursos de acceso público en internet para desarrollar modelos generativos: los conjuntos de datos pueden generarse de otras maneras, como a través de donaciones de datos, soluciones eficaces de consentimiento o la recopilación de datos por parte del propio responsable del tratamiento. No obstante, ninguna de estas opciones alternativas podría proporcionar la amplitud de datos requerida”. Ruschemeier, “Generative AI and Data Protection”, p. 7, traducción del autor.
× 22 Ver EDPB, Opinion 28/2024, p. 24.
× 23 Ver ibid., p. 24.
× 24 Ver ibid., Opinion 28/2024, pp. 26-28.
× 25 Ruschemeier, “Generative AI and Data Protection”, p. 8
× 26 Ibid., p. 8.
× 27 Ver EDPB, Opinion 28/2024, p. 25
× 28 Ver ibid., p. 28.
× 29 Sobre la privacidad en el derecho constitucional chileno, ver Rodolfo Figueroa García-Huidobro, Privacidad (Santiago: Editorial Universidad Diego Portales, 2014); sobre el derecho a la protección de datos personales, Pablo Contreras, “El derecho a la protección de datos personales y el reconocimiento de la autodeterminación informativa en la Constitución chilena”, Estudios constitucionales 18, no 2 (2020): 87–120; sobre la filosofía de la privacidad, ver Carissa Véliz, The Ethics of Privacy and Surveillance (Oxford University Press, 2024).