Em 2026, poucos temas concentram tantas tensões regulatórias quanto o uso de obras protegidas por direitos autorais para o treinamento de sistemas de inteligência artificial (“IA”). O avanço dos modelos generativos, isto é, aqueles criados para produzir dados novos com base nos padrões aprendidos durante seus treinamentos, transformou uma discussão antes restrita a especialistas em uma questão estratégica.
A razão é simples. Os modelos mais avançados de IA dependem da análise de volumes massivos de dados para identificar tais padrões. Em muitos casos, e possivelmente na maior parte deles, esses conjuntos de dados incluem obras protegidas pelo direito autoral, como livros, artigos, fotografias, obras audiovisuais e músicas.
A crescente capacidade desses sistemas de produzir materiais com qualidade cada vez mais próxima da produção humana trouxe uma questão jurídica fundamental: o uso dessas obras autorais no treinamento de modelos de linguagem e algoritmos é legítimo ou representa exploração de direitos que depende de autorização e remuneração dos titulares?
A pergunta não está restrita ao Brasil, e as respostas vêm sendo construídas de forma bastante distinta ao redor do mundo. O resultado é um cenário de fragmentação regulatória que pode influenciar diretamente a capacidade de países atraírem investimentos, desenvolverem tecnologia própria e participarem da corrida internacional pela liderança em inteligência artificial.
O modelo europeu: incentivo à inovação com mecanismos de controle
A União Europeia foi uma das primeiras jurisdições a enfrentar expressamente o tema. A Diretiva (EU) 2019/790 introduziu regras específicas para atividades de text and data mining (“TDM”), expressão utilizada para designar a análise automatizada de grandes volumes de dados com o objetivo de identificar informações, padrões e tendências.1
A Diretiva reconhece que a mineração de textos e dados constitui atividade essencial para a pesquisa científica e a inovação tecnológica. Ao mesmo tempo, buscou preservar os interesses dos titulares de direitos por meio de mecanismos de reserva de uso (opt-out, isto é, a possibilidade de o titular excluir suas obras dessas atividades). Assim, determinados conteúdos podem ser excluídos quando houver manifestação expressa do titular.2
A opção europeia é relevante porque parte da premissa de que o desenvolvimento da IA depende do acesso a dados em larga escala. Em vez de exigir autorização prévia para toda e qualquer utilização de obras protegidas, o modelo procura estabelecer instrumentos de equilíbrio entre inovação tecnológica e proteção autoral.
Mais recentemente, o Regulamento Europeu de Inteligência Artificial (conhecido como “AI Act”) acrescentou outra camada regulatória ao debate. Embora não discipline especificamente o direito autoral, o AI Act impõe obrigações de transparência relacionadas aos dados utilizados no treinamento de determinados modelos de IA, fortalecendo demandas por rastreabilidade e governança dos conjuntos de dados empregados pelos desenvolvedores.3
O debate brasileiro à luz do modelo europeu
No Brasil, a discussão assume fundamental relevância durante a tramitação do Projeto de Lei nº 2.338/2023 (“PL nº 2338”), que busca instituir o marco regulatório para a inteligência artificial.4
O tema tornou-se particularmente sensível porque a legislação autoral brasileira, atualmente regida pela Lei nº 9.610/1998, foi concebida em um contexto tecnológico muito anterior à IA generativa e não contém disposições específicas sobre mineração de dados ou treinamento de modelos algorítmicos.5
Sem regras específicas para IA, o debate passou a girar em torno de uma questão central: as cópias técnicas realizadas durante o treinamento de modelos podem ser consideradas reproduções juridicamente relevantes de obras protegidas e, portanto, sujeitas à autorização dos respectivos titulares?
As diferentes versões discutidas no âmbito do PL nº 2.338 revelam uma inclinação regulatória potencialmente mais protetiva dos titulares de direitos. De forma geral, as propostas debatidas atribuem maior peso à necessidade de autorização e remuneração pelo uso de conteúdos protegidos, admitindo exceções mais limitadas para atividades de pesquisa e instituições sem fins lucrativos. Caso essa orientação prevaleça, o Brasil poderá adotar um regime significativamente mais restritivo do que o europeu.
Impasse entre titulares e desenvolvedores
Entidades representativas de autores sustentam que os sistemas de IA extraem valor de obras protegidas sem que seus titulares necessariamente participem dos benefícios econômicos gerados. Sob essa perspectiva, mecanismos de autorização e remuneração seriam necessários para preservar os incentivos econômicos que historicamente justificam a proteção autoral.
Por outro lado, setores de infraestrutura econômica e social, empresas de tecnologia, pesquisadores e organizações ligadas à economia digital argumentam que exigir autorização de cada titular pode gerar custos de negociação incompatíveis com a realidade técnica do treinamento de modelos. Em muitos casos, os conjuntos de dados contêm milhões ou até bilhões de documentos. Por isso, seria praticamente inviável negociar com todos os titulares envolvidos.
A expansão da IA generativa adicionou uma nova dimensão à controvérsia. Ainda que o treinamento tenha finalidade meramente analítica, cresce a preocupação de que determinados modelos possam gerar saídas que reproduzam elementos expressivos, estilos ou trechos identificáveis de obras utilizadas durante o treinamento, potencialmente afetando mercados já explorados pelos respectivos titulares.
Para além do direito autoral
As discussões sobre treinamento de IA frequentemente são apresentadas em termos abstratos. Em um olhar mais amplo, o debate não deve ser tratado exclusivamente como uma questão de propriedade intelectual. Na prática, a demanda crescente por conjuntos de dados de alta qualidade vem produzindo impactos concretos sobre o ecossistema de produção e acesso ao conhecimento.
Recentemente, o tema ganhou novos contornos com a divulgação de práticas adotadas por empresas ligadas ao desenvolvimento de sistemas de IA, especialmente na Europa e nos Estados Unidos, envolvendo a aquisição, em larga escala, de exemplares físicos de livros destinados à digitalização para fins de treinamento de modelos.6
Em alguns casos, o processo envolve a remoção das lombadas para permitir o escaneamento industrial das obras, seguida do descarte ou reciclagem dos exemplares físicos. Embora os defensores da prática sustentem que ela constitui um método eficiente de conversão de acervos analógicos em bases de dados aptas a alimentar sistemas, o fenômeno tem suscitado preocupações que transcendem a tradicional discussão sobre direitos autorais.
Além dos questionamentos sobre a legalidade do uso das obras digitalizadas no treinamento algorítmico, surgiram debates sobre a concentração privada de vastos repositórios de conhecimento e também se discute a crescente assimetria de informação entre grandes empresas de tecnologia e os demais atores da cadeia criativa.
O episódio evidencia que a regulação do treinamento de sistemas de IA não envolve apenas a tutela dos interesses econômicos dos titulares de direitos, mas também questões mais amplas de acesso ao conhecimento, diversidade cultural e governança da informação na economia digital.
O desafio regulatório brasileiro
Nesse contexto, o desafio consiste em construir soluções capazes de oferecer previsibilidade jurídica sem comprometer a capacidade de inovação. Transparência sobre fontes de dados, mecanismos de governança, sistemas de licenciamento coletivo, procedimentos de exclusão de conteúdo e modelos de remuneração proporcional figuram entre as alternativas que vêm sendo discutidas internacionalmente para conciliar interesses potencialmente conflitantes.
Sem esse equilíbrio, regras que limitem excessivamente o treinamento de IA podem reduzir o ritmo da inovação tecnológica no Brasil e acelerar a fuga de talentos, investimentos e tecnologias para o exterior. O efeito seria negativo para a posição do país na economia global e para a capacidade de desenvolver soluções locais customizadas às necessidades do mercado brasileiro, que dependem do conhecimento, dados e infraestrutura disponíveis no país.
Mais do que resolver uma disputa entre autores e indústria, a decisão regulatória que o Brasil vier a adotar ajudará a definir como o país pretende participar da economia baseada em inteligência artificial nas próximas décadas. O tratamento conferido ao treinamento de modelos será um dos fatores determinantes para a competitividade tecnológica em um cenário cada vez mais orientado por dados.
Referências:
1 Nos termos do art. 2(2) da Diretiva (UE) 2019/790, entende-se por TDM “qualquer técnica analítica automatizada destinada a analisar textos e dados em formato digital para gerar informações, incluindo, entre outras, padrões, tendências e correlações”. Disponível em: https://eur-lex.europa.eu/eli/dir/2019/790/oj.
2 O mecanismo de reserva de direitos (opt-out) está previsto no art. 4(3) da Diretiva (UE) 2019/790, segundo o qual: “A exceção ou limitação prevista no n.º 1 é aplicável desde que a utilização de obras e de outro material protegido a que se refere esse número não tenha sido expressamente reservada pelos respetivos titulares de direitos de forma adequada, em particular por meio de leitura ótica no caso de conteúdos disponibilizados ao público em linha“.
3 O Regulamento (UE) 2024/1689 (AI Act) impõe aos provedores de modelos de IA de propósito geral obrigações relacionadas à observância da legislação europeia de direitos autorais e à disponibilização de informações suficientemente detalhadas sobre os dados utilizados no treinamento dos modelos. Disponível em: https://eur-lex.europa.eu/eli/reg/2024/1689/oj.
4 Projeto de Lei nº 2.338/2023. Disponível em: https://www25.senado.leg.br/web/atividade/materias/-/materia/157233.
5 A Lei nº 9.610/1998 define “reprodução”, em art. 5º, inciso VI, como “a cópia de um ou vários exemplares de uma obra literária, artística ou científica ou de um fonograma, de qualquer forma tangível, incluindo qualquer armazenamento permanente ou temporário por meios eletrônicos ou qualquer outro meio de fixação que venha a ser desenvolvido“. É justamente a amplitude desse conceito que alimenta parte do debate sobre o treinamento de modelos de IA. Disponível em: https://www.planalto.gov.br/ccivil_03/leis/l9610.htm.
6 Reportagem da CNN Brasil. Disponível em: https://www.cnnbrasil.com.br/pop/novos-treinamentos-de-ias-geram-destruicao-em-massa-de-livros-entenda/.


