O Contexto: Reddit, Google e a Disputa por Dados
O Reddit, uma das maiores plataformas de discussão online do mundo, tem travado uma batalha judicial incomum contra gigantes da tecnologia, incluindo o Google e empresas de IA como a Perplexity. A disputa gira em torno do uso não autorizado de dados do Reddit por meio de web scraping — prática de extrair informações de sites de forma automatizada. O caso ganhou destaque não apenas por sua complexidade jurídica, mas também por levantar questões fundamentais sobre propriedade de dados, ética na IA e o futuro da web aberta.
O Início da Disputa: DMCA e Google
Em outubro de 2024, o Reddit moveu uma ação judicial contra a SerpApi e a Perplexity, acusando-as de violar a Digital Millennium Copyright Act (DMCA) ao raspar conteúdo do Reddit que aparecia nos resultados de busca do Google. A plataforma argumentou que essas empresas estavam contornando suas proteções tecnológicas para acessar dados protegidos, ameaçando seu modelo de negócios baseado em licenciamento de dados.
O caso tomou um rumo inesperado quando o Google, em uma manobra jurídica considerada “estranha” por especialistas, entrou na disputa. O Google argumentou que os resultados de busca — que incluem trechos de conteúdo do Reddit — não poderiam ser protegidos por direitos autorais, uma vez que a empresa não é proprietária dos dados originais. No entanto, em setembro de 2025, um tribunal concedeu uma vitória inicial à SerpApi, rejeitando o argumento do Google e destacando que a empresa não tinha legitimidade para processar por violação de DMCA, já que não era detentora dos direitos autorais do conteúdo.
Ação Contra a Perplexity: Acusações de Conspiração e Roubo de Dados
Em junho de 2024, o Reddit intensificou sua ofensiva jurídica ao processar a Perplexity AI, uma startup de busca baseada em IA, acusando-a de conspirar com intermediários de web scraping para obter acesso ilegal a seus dados. A ação, movida em um tribunal federal de Nova York, também incluiu empresas como a SerpApi, a Oxylabs (com sede na Lituânia) e a AWM Proxy, descrita pelo Reddit como uma “antiga botnet russa”.
Segundo a denúncia, a Perplexity ignorou um cease-and-desist enviado pelo Reddit em maio de 2024, no qual a plataforma exigia a interrupção imediata do scraping não autorizado. A Perplexity, por sua vez, negou as acusações, alegando que respeita os arquivos robots.txt — diretrizes técnicas que indicam quais partes de um site podem ou não ser rastreadas por bots. No entanto, o Reddit argumentou que a empresa estava usando métodos sofisticados para contornar essas proteções, incluindo o uso de proxies e bots para mascarar sua atividade.
O Argumento do Reddit: Dados como Ativo Estratégico
O Reddit enxerga seus dados como um ativo valioso e estratégico. Em seu registro S-1, apresentado à SEC em fevereiro de 2024, a plataforma descreveu seu corpus de dados como “uma fonte única de acesso em tempo real a tópicos dinâmicos e em evolução”, destacando seu valor para empresas de IA e mecanismos de busca. Para monetizar esse ativo, o Reddit firmou acordos de licenciamento com empresas como Google e OpenAI, garantindo receitas significativas em troca do acesso programático a seus dados.
A plataforma argumenta que o scraping não autorizado ameaça esse modelo de negócios, pois permite que concorrentes acessem seus dados sem compensação financeira. Em uma analogia usada na ação judicial, o Reddit comparou as empresas acusadas a “ladrões de banco” que, ao não conseguirem invadir o cofre, decidem assaltar o carro-forte que transporta o dinheiro.
O Impacto da IA nos Modelos de Negócios Digitais
A disputa entre Reddit e empresas de IA reflete um debate mais amplo sobre o impacto da inteligência artificial nos modelos de negócios digitais. Com o lançamento do Google AI Overview em maio de 2024, plataformas como o Reddit viram uma queda acentuada no tráfego orgânico proveniente de buscas. Segundo um estudo da Similarweb, a porcentagem de pesquisas que resultam em cliques ou visitas a sites caiu de 56% para 69% após o lançamento da ferramenta, enquanto o tráfego orgânico despencou de 2,3 bilhões para 1,7 bilhão de visitas.
Steve Huffman, CEO do Reddit, afirmou em entrevista ao CNBC que a empresa está preocupada com a forma como o Google tem priorizado respostas geradas por IA em detrimento dos “10 links azuis” tradicionais, que historicamente direcionavam tráfego para sites como o Reddit. Huffman sugeriu que a plataforma estaria considerando cortar o acesso do Google a seus dados, uma medida drástica que poderia redefinir a relação entre grandes plataformas e mecanismos de busca.
As Implicações Jurídicas e o Futuro da Web Aberta
A batalha judicial do Reddit levanta questões cruciais sobre o futuro da web aberta. Especialistas apontam que o uso da DMCA para proteger resultados de busca — que, em teoria, não são protegidos por direitos autorais — é uma estratégia jurídica arriscada e pouco convencional. Para críticos, como a SerpApi, as ações do Reddit e do Google representam uma tentativa de “cercar a internet”, controlando o acesso a dados que, até então, eram considerados públicos.
Em um comunicado ao Ars Technica, a SerpApi afirmou: “O cerne da questão é que tanto o Google quanto o Reddit parecem estar tentando usar a DMCA para bloquear o acesso à internet aberta, reivindicando controle retroativo sobre conteúdo que não criaram nem possuem”. A empresa argumenta que, ao tentar restringir o scraping, as plataformas estão desafiando a natureza descentralizada e colaborativa da web.
O Que Esperar dos Próximos Capítulos
Embora o tribunal tenha concedido uma vitória inicial à SerpApi ao rejeitar o argumento do Google, a batalha está longe de terminar. O Google ainda tem uma chance limitada de recorrer da decisão, e o caso contra a Perplexity e outras empresas de scraping promete ser longo e complexo. Enquanto isso, o Reddit continua sua ofensiva jurídica, tendo processado também a Anthropic em junho de 2024 por scraping não autorizado.
Para observadores do setor, o desfecho desses casos pode definir precedentes importantes para a indústria de tecnologia. Se o Reddit prevalecer, outras plataformas podem seguir seu exemplo, endurecendo suas políticas de acesso a dados e exigindo compensações financeiras por seu uso. Por outro lado, uma derrota poderia reforçar a ideia de que a web deve permanecer aberta e acessível, mesmo que isso signifique desafiar os interesses comerciais de grandes empresas.
Uma coisa é certa: a disputa entre Reddit, Google e empresas de IA é apenas o começo de uma discussão mais ampla sobre quem controla os dados na era da inteligência artificial — e como esses dados serão usados para moldar o futuro da internet.