Este projeto é um analisador léxico simples desenvolvido em Python pelo aluno Nathan Balmant De Paual Souza.
O programa realiza as seguintes etapas:
-
Verificação Léxica:
Detecta e rejeita caracteres que não pertencem ao teclado brasileiro, como letras de outros alfabetos ou emojis. -
Remoção de Stopwords:
Remove palavras comuns da língua portuguesa (como "o", "a", "de", "por", etc.) que não agregam valor semântico à análise.🔗 Fonte das stopwords:
A lista foi obtida da bibliotecanltk, mais especificamente:
NLTK stopwords corpus -
Correção de Palavras com Erros de Digitação (Similaridade):
Caso o usuário forneça um dicionário de palavras válidas, o analisador corrige palavras digitadas incorretamente com base na similaridade textual.🔗 Fonte da função de similaridade:
Foi usada a funçãoget_close_matches()da biblioteca padrãodifflibdo Python.
Documentação oficial - difflib -
Tabela de Símbolos:
Registra todas as palavras relevantes (exceto stopwords e inválidas) com a contagem de quantas vezes apareceram. -
Fila de Tokens:
Constrói uma fila com todas as palavras e pontuações separadas, na ordem em que apareceram no texto.
- Python 3.x instalado
- Biblioteca
nltkinstalada
Para instalar o nltk, execute:
pip install nltkDepois, abra um terminal e execute uma única vez o seguinte código no Python para baixar as stopwords:
import nltk
nltk.download('stopwords')python analisador_lexico.pyDigite uma frase quando solicitado e veja o analisador em ação!
- O programa aceita letras do alfabeto latino com acentos (como "á", "é", "ç", etc.).
- Palavras com caracteres não permitidos serão descartadas e listadas como inválidas.
- A função de correção (
similaridade) está preparada para ser usada, mas requer um dicionário de palavras válidas preenchido.