Nevolus IA – Importação de Sites

Índice

Importação de Sites

A Importação de Sites transforma páginas de um site externo em artigos privados no WordPress. Esses artigos passam a compor a base de conhecimento usada pelos chatbots da Nevolus IA.

O recurso usa o Firecrawl para acessar o site, extrair o conteúdo principal das páginas e convertê-lo para um formato adequado para IA.

Antes de começar

Você precisa de:

  1. Uma conta no Firecrawl.
  2. Uma API Key do Firecrawl.
  3. O Webhook Signing Secret da conta Firecrawl.
  4. Permissão para gerenciar configurações no WordPress.

Mantenha a API Key e o Webhook Secret em sigilo. Não os compartilhe em conversas, documentos públicos ou capturas de tela.

Acessando a Importação de Sites

No painel da Nevolus IA, abra Chatbots > Recursos adicionais e, na seção Conteúdo e base de conhecimento, selecione Importação de Sites.

Configurando o Firecrawl

Na seção Configurações Firecrawl, informe:

  • API Key: obtida no painel da sua conta Firecrawl, em API Keys.
  • Webhook Secret: obtido no painel da sua conta Firecrawl, em Configurações > Avançado > Webhook Signing Secret.

Depois, clique em Salvar configurações.

Criando uma fonte de importação

Na seção Nova fonte de importação, preencha os campos abaixo.

Nome

É o nome interno da fonte, usado apenas para identificação.

Exemplo:

Site institucional

URL base

É o endereço inicial do site ou da área que será importada.

Exemplo: https://www.seu_web_site

A URL deve ser pública e usar HTTP ou HTTPS.

Profundidade

Define quantos níveis de links o Firecrawl poderá percorrer a partir da URL base.

Para um teste inicial, use valores entre 3 e 5.

Limite de páginas

Define a quantidade máxima de páginas por execução.

O limite atual é de 600 páginas por execução. Comece com um número menor, como 50 ou 100, e aumente depois de revisar o resultado.

Concorrência

Define quantas páginas podem ser processadas em paralelo pelo Firecrawl.

Recomendação inicial: 2

Include paths

Campo opcional. Use um padrão por linha para importar somente áreas específicas do site.

Exemplo:

/docs/*
/faq/*

Quando esse campo estiver preenchido, somente URLs que correspondam a pelo menos um dos padrões serão consideradas.

Exclude paths

Use um padrão por linha para ignorar áreas, páginas ou arquivos que não devem entrar na base de conhecimento.

Exemplo:

/blog/*
/tag/*
/categoria/*
/login/*
*.pdf
*.docx
*.zip

Use esse campo para evitar páginas duplicadas, áreas administrativas, arquivos inadequados ou conteúdos fora do escopo do chatbot.

Opções da fonte

Sincronizar com a origem em varreduras completas

Quando ativada, a sincronização identifica páginas que deixaram de existir no site de origem.

A proteção funciona assim:

  1. Na primeira varredura completa em que a página não for encontrada, ela é marcada como missing.
  2. Se continuar ausente na próxima varredura completa com sincronização, o artigo correspondente é movido para a lixeira.

Para reduzir o risco de remoções indevidas, o sistema não executa essa sincronização se a varredura encontrar menos de 50% das páginas já conhecidas da fonte, desde que existam mais de três páginas conhecidas.

Ative essa opção somente quando a fonte e os filtros estiverem bem revisados.

Usar limpeza adicional do Firecrawl

Ative esta opção se o conteúdo importado vier com muito ruído, como menus, rodapés, banners, newsletters, comentários ou blocos de conteúdo relacionado.

Depois da primeira importação, revise os artigos para decidir se a limpeza adicional melhora o resultado para o seu caso.

Excluir links para imagens e documentos do conteúdo

Por padrão, links do conteúdo original são preservados.

Quando esta opção estiver ativada, o módulo remove do artigo importado links que apontem para imagens, documentos e outros arquivos de mídia, como PDF, DOCX, planilhas, apresentações, ZIPs, áudios e vídeos.

Use esta opção quando esses links não forem úteis ao chatbot ou poluírem o conteúdo importado.

Recorrência incremental

As opções são:

  • Manual: nenhuma execução incremental automática.
  • Diária incremental: procura URLs novas aproximadamente uma vez por dia.

A importação incremental adiciona somente páginas novas. Ela não atualiza páginas já importadas e não remove artigos que desapareceram da origem.

Varredura completa

As opções são:

  • Manual
  • Diária
  • Semanal
  • Mensal

A varredura completa verifica páginas novas e existentes, atualiza o conteúdo que mudou e, quando a sincronização estiver ativada, identifica remoções da origem.

Quando houver uma varredura completa vencida, ela terá prioridade sobre a execução incremental diária.

Executando uma importação

Na tabela Fontes cadastradas, há duas ações:

  • Executar incremental: importa somente URLs novas encontradas na fonte.
  • Executar varredura completa: verifica páginas novas e existentes; também permite atualização de conteúdo e sincronização de remoções, quando habilitada.

Para a primeira importação, use Executar varredura completa.

Acompanhe o processamento na tabela Execuções recentes. Para ver eventos detalhados, clique em Log.

Status das execuções

  • queued: execução criada e aguardando início.
  • running: importação em andamento.
  • completed: execução finalizada sem falhas registradas.
  • completed_with_errors: execução concluída, mas uma ou mais páginas falharam.
  • failed: a execução não pôde ser concluída.

Colunas das execuções

  • Vistas: páginas recebidas e avaliadas pelo sistema.
  • Importadas: artigos criados ou atualizados.
  • Alteradas: páginas cujo conteúdo foi criado ou atualizado.
  • Inalteradas: páginas já conhecidas cujo conteúdo não mudou.
  • Falhas: páginas que não puderam ser processadas.
  • Erro/Resumo: informações relevantes sobre a execução.

Visualizando páginas importadas

Na tabela Fontes cadastradas, clique em Páginas.

A tela mostra, para cada página:

  • artigo correspondente;
  • título;
  • URL de origem;
  • status;
  • checksum do conteúdo;
  • última execução em que a página foi vista;
  • data da última importação;
  • erros registrados, quando houver.

Os status possíveis são:

  • active: página ativa e importada corretamente.
  • missing: página não foi encontrada na última varredura completa com sincronização.
  • removed: artigo movido para a lixeira após duas varreduras completas consecutivas sem encontrar a página.
  • failed: ocorreu uma falha ao importar ou atualizar a página.

Se uma página marcada como missing reaparecer em uma varredura completa, ela volta ao status active.

Como as atualizações funcionam

O sistema calcula um checksum do conteúdo importado.

  • Se o conteúdo não mudou, o artigo não é atualizado.
  • Se o conteúdo mudou, o artigo é atualizado.
  • Se um artigo importado tiver sido apagado manualmente, ele poderá ser recriado em uma futura varredura completa.

Evite editar manualmente o conteúdo de artigos gerenciados pela importação, pois uma atualização da origem poderá substituir essas alterações.

Excluindo uma fonte

Na tabela Fontes cadastradas, clique em Excluir.

A exclusão da fonte não remove automaticamente os artigos já importados. Se necessário, revise e remova esses artigos separadamente no WordPress.

Boas práticas

  • Comece com uma fonte pequena e um limite baixo de páginas.
  • Faça a primeira importação com varredura completa.
  • Revise os artigos antes de ampliar o escopo.
  • Use Include paths para limitar o conteúdo ao que é útil para o chatbot.
  • Use Exclude paths para evitar áreas irrelevantes, duplicadas ou privadas.
  • Ative a sincronização somente após validar filtros, URL base e resultado da importação.
  • Use varreduras completas periódicas quando precisar manter conteúdos existentes atualizados.
  • Consulte os logs sempre que uma execução terminar com falhas.

Limitações conhecidas

  • PDFs e outros documentos podem exigir tratamento específico. Quando necessário, exclua-os da varredura e use o fluxo próprio de upload de documentos na área de Conhecimento.
  • Sites com conteúdo muito dinâmico podem exigir ajustes de filtros ou revisão manual dos artigos.
  • A execução depende da disponibilidade do site de origem, do Firecrawl e do agendamento do WordPress.
  • Importações grandes podem levar mais tempo e consumir mais créditos do Firecrawl.

Posts Similares