A tarefa
A agência precisava encontrar domínios de confiança entre os que estão sendo liberados (drops), com boas métricas, idade respeitável e histórico limpo, para depois capturá-los e utilizá-los. As listas de drops estão espalhadas por dezenas de plataformas, os formatos variam e os volumes são enormes: cobrir isso manualmente é inviável.
O que fizemos e quais dados coletamos
Reunimos a lista de plataformas que publicam listas de domínios expirados e drops — GoDaddy, DropCatch, SnapNames, nicsell, Dynadot, Kifdom, Sav, UKBackorder, Catched, park.io, Namecheap, NameSilo, Gname, Aftermarket, Domainlore.uk e outras — e organizamos a coleta regular de suas exportações em um fluxo único.
Depois, o enriquecimento. Trouxemos as datas de drop para um fuso único, para saber quando o domínio é liberado de fato. Complementamos as métricas pelas APIs do Ahrefs e do Moz (autoridade e perfil de links), puxamos o WHOIS para idade e histórico de registro e, para os domínios pré-selecionados, adicionamos os dados do arquivo da web — para ver o que era hospedado antes no domínio e qual era o idioma do site. Além disso, construímos uma interface na qual os analistas da agência fazem a pontuação manual final dos candidatos já coletados e enriquecidos.
O projeto foi estruturado como busca e enriquecimento de dados sobre uma base de dados de domínios, com entrega em uma interface prática e exportações (DaaS).
Dificuldades e como as resolvemos
A principal: a escala. Centenas de milhares de domínios expiram todos os dias, e rodar o pacote completo de verificações em todos não faz sentido. Montamos um pipeline: primeiro coletamos e deduplicamos as listas de domínios expirados, depois enriquecemos com métricas, e as etapas caras (arquivo da web) rodam apenas para os domínios pré-selecionados que passaram pelo primeiro filtro. O processo roda diariamente.
A segunda: a heterogeneidade das fontes. Cada plataforma tem seu formato de lista e seu jeito de indicar a data e a hora do drop. Trouxemos tudo para um esquema único e um horário único; quanto à padronização, veja nosso artigo sobre normalização de dados.
A terceira — e decisiva: descartar os domínios com passado “sujo”, os que já expiraram antes e hospedaram spam. Pelas métricas, um domínio desses pode parecer atraente, mas na prática está queimado. Verificamos o histórico pelo arquivo da web e pelos sinais de drops anteriores, para que esses candidatos não seguissem adiante. O trabalho com APIs externas (Ahrefs, Moz, WHOIS) também ajudou no enriquecimento rápido.
Vale registrar: essas plataformas não têm proteção contra coleta — a tarefa não era contornar bloqueios, e sim garantir escala e qualidade dos dados.
O resultado
A agência obteve um fluxo diário único de domínios em drop, enriquecido com métricas, idade e histórico, e uma interface para a pontuação manual: a avaliação dos candidatos acontece em um só lugar, sem precisar percorrer dezenas de plataformas e conferir métricas manualmente.
Serviços usados neste caso: Busca e enriquecimento de dados · Base de dados de domínios · DaaS e dados via API · Dados para SEO e busca