Índice
- Informações Gerais
- Instruções de Chatbots
- Treinamento de Chatbots
- Recursos Adicionais
- Importação de Sites
- Importação de WordPress
- API – Conversas com Chatbots
Importação de Sites
A Importação de Sites transforma páginas de um site externo em artigos privados no WordPress. Esses artigos passam a compor a base de conhecimento usada pelos chatbots da Nevolus IA.
O recurso usa o Firecrawl para acessar o site, extrair o conteúdo principal das páginas e convertê-lo para um formato adequado para IA.
Antes de começar
Você precisa de:
- Uma conta no Firecrawl.
- Uma API Key do Firecrawl.
- O Webhook Signing Secret da conta Firecrawl.
- Permissão para gerenciar configurações no WordPress.
Mantenha a API Key e o Webhook Secret em sigilo. Não os compartilhe em conversas, documentos públicos ou capturas de tela.
Acessando a Importação de Sites
No painel da Nevolus IA, abra Chatbots > Recursos adicionais e, na seção Conteúdo e base de conhecimento, selecione Importação de Sites.
Configurando o Firecrawl
Na seção Configurações Firecrawl, informe:
- API Key: obtida no painel da sua conta Firecrawl, em API Keys.
- Webhook Secret: obtido no painel da sua conta Firecrawl, em Configurações > Avançado > Webhook Signing Secret.
Depois, clique em Salvar configurações.
Criando uma fonte de importação
Na seção Nova fonte de importação, preencha os campos abaixo.
Nome
É o nome interno da fonte, usado apenas para identificação.
Exemplo:
Site institucional
URL base
É o endereço inicial do site ou da área que será importada.
Exemplo: https://www.seu_web_site
A URL deve ser pública e usar HTTP ou HTTPS.
Profundidade
Define quantos níveis de links o Firecrawl poderá percorrer a partir da URL base.
Para um teste inicial, use valores entre 3 e 5.
Limite de páginas
Define a quantidade máxima de páginas por execução.
O limite atual é de 600 páginas por execução. Comece com um número menor, como 50 ou 100, e aumente depois de revisar o resultado.
Concorrência
Define quantas páginas podem ser processadas em paralelo pelo Firecrawl.
Recomendação inicial: 2
Include paths
Campo opcional. Use um padrão por linha para importar somente áreas específicas do site.
Exemplo:
/docs/*
/faq/*
Quando esse campo estiver preenchido, somente URLs que correspondam a pelo menos um dos padrões serão consideradas.
Exclude paths
Use um padrão por linha para ignorar áreas, páginas ou arquivos que não devem entrar na base de conhecimento.
Exemplo:
/blog/*
/tag/*
/categoria/*
/login/*
*.pdf
*.docx
*.zip
Use esse campo para evitar páginas duplicadas, áreas administrativas, arquivos inadequados ou conteúdos fora do escopo do chatbot.
Opções da fonte
Sincronizar com a origem em varreduras completas
Quando ativada, a sincronização identifica páginas que deixaram de existir no site de origem.
A proteção funciona assim:
- Na primeira varredura completa em que a página não for encontrada, ela é marcada como
missing. - Se continuar ausente na próxima varredura completa com sincronização, o artigo correspondente é movido para a lixeira.
Para reduzir o risco de remoções indevidas, o sistema não executa essa sincronização se a varredura encontrar menos de 50% das páginas já conhecidas da fonte, desde que existam mais de três páginas conhecidas.
Ative essa opção somente quando a fonte e os filtros estiverem bem revisados.
Usar limpeza adicional do Firecrawl
Ative esta opção se o conteúdo importado vier com muito ruído, como menus, rodapés, banners, newsletters, comentários ou blocos de conteúdo relacionado.
Depois da primeira importação, revise os artigos para decidir se a limpeza adicional melhora o resultado para o seu caso.
Excluir links para imagens e documentos do conteúdo
Por padrão, links do conteúdo original são preservados.
Quando esta opção estiver ativada, o módulo remove do artigo importado links que apontem para imagens, documentos e outros arquivos de mídia, como PDF, DOCX, planilhas, apresentações, ZIPs, áudios e vídeos.
Use esta opção quando esses links não forem úteis ao chatbot ou poluírem o conteúdo importado.
Recorrência incremental
As opções são:
- Manual: nenhuma execução incremental automática.
- Diária incremental: procura URLs novas aproximadamente uma vez por dia.
A importação incremental adiciona somente páginas novas. Ela não atualiza páginas já importadas e não remove artigos que desapareceram da origem.
Varredura completa
As opções são:
- Manual
- Diária
- Semanal
- Mensal
A varredura completa verifica páginas novas e existentes, atualiza o conteúdo que mudou e, quando a sincronização estiver ativada, identifica remoções da origem.
Quando houver uma varredura completa vencida, ela terá prioridade sobre a execução incremental diária.
Executando uma importação
Na tabela Fontes cadastradas, há duas ações:
- Executar incremental: importa somente URLs novas encontradas na fonte.
- Executar varredura completa: verifica páginas novas e existentes; também permite atualização de conteúdo e sincronização de remoções, quando habilitada.
Para a primeira importação, use Executar varredura completa.
Acompanhe o processamento na tabela Execuções recentes. Para ver eventos detalhados, clique em Log.
Status das execuções
- queued: execução criada e aguardando início.
- running: importação em andamento.
- completed: execução finalizada sem falhas registradas.
- completed_with_errors: execução concluída, mas uma ou mais páginas falharam.
- failed: a execução não pôde ser concluída.
Colunas das execuções
- Vistas: páginas recebidas e avaliadas pelo sistema.
- Importadas: artigos criados ou atualizados.
- Alteradas: páginas cujo conteúdo foi criado ou atualizado.
- Inalteradas: páginas já conhecidas cujo conteúdo não mudou.
- Falhas: páginas que não puderam ser processadas.
- Erro/Resumo: informações relevantes sobre a execução.
Visualizando páginas importadas
Na tabela Fontes cadastradas, clique em Páginas.
A tela mostra, para cada página:
- artigo correspondente;
- título;
- URL de origem;
- status;
- checksum do conteúdo;
- última execução em que a página foi vista;
- data da última importação;
- erros registrados, quando houver.
Os status possíveis são:
- active: página ativa e importada corretamente.
- missing: página não foi encontrada na última varredura completa com sincronização.
- removed: artigo movido para a lixeira após duas varreduras completas consecutivas sem encontrar a página.
- failed: ocorreu uma falha ao importar ou atualizar a página.
Se uma página marcada como missing reaparecer em uma varredura completa, ela volta ao status active.
Como as atualizações funcionam
O sistema calcula um checksum do conteúdo importado.
- Se o conteúdo não mudou, o artigo não é atualizado.
- Se o conteúdo mudou, o artigo é atualizado.
- Se um artigo importado tiver sido apagado manualmente, ele poderá ser recriado em uma futura varredura completa.
Evite editar manualmente o conteúdo de artigos gerenciados pela importação, pois uma atualização da origem poderá substituir essas alterações.
Excluindo uma fonte
Na tabela Fontes cadastradas, clique em Excluir.
A exclusão da fonte não remove automaticamente os artigos já importados. Se necessário, revise e remova esses artigos separadamente no WordPress.
Boas práticas
- Comece com uma fonte pequena e um limite baixo de páginas.
- Faça a primeira importação com varredura completa.
- Revise os artigos antes de ampliar o escopo.
- Use Include paths para limitar o conteúdo ao que é útil para o chatbot.
- Use Exclude paths para evitar áreas irrelevantes, duplicadas ou privadas.
- Ative a sincronização somente após validar filtros, URL base e resultado da importação.
- Use varreduras completas periódicas quando precisar manter conteúdos existentes atualizados.
- Consulte os logs sempre que uma execução terminar com falhas.
Limitações conhecidas
- PDFs e outros documentos podem exigir tratamento específico. Quando necessário, exclua-os da varredura e use o fluxo próprio de upload de documentos na área de Conhecimento.
- Sites com conteúdo muito dinâmico podem exigir ajustes de filtros ou revisão manual dos artigos.
- A execução depende da disponibilidade do site de origem, do Firecrawl e do agendamento do WordPress.
- Importações grandes podem levar mais tempo e consumir mais créditos do Firecrawl.
