Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

1 Commit
 
 
 
 

Repository files navigation

Analisador Léxico para Linguagem Natural

Este projeto é um analisador léxico simples desenvolvido em Python pelo aluno Nathan Balmant De Paual Souza.


🧠 Funcionalidades

O programa realiza as seguintes etapas:

  1. Verificação Léxica:
    Detecta e rejeita caracteres que não pertencem ao teclado brasileiro, como letras de outros alfabetos ou emojis.

  2. Remoção de Stopwords:
    Remove palavras comuns da língua portuguesa (como "o", "a", "de", "por", etc.) que não agregam valor semântico à análise.

    🔗 Fonte das stopwords:
    A lista foi obtida da biblioteca nltk, mais especificamente:
    NLTK stopwords corpus

  3. Correção de Palavras com Erros de Digitação (Similaridade):
    Caso o usuário forneça um dicionário de palavras válidas, o analisador corrige palavras digitadas incorretamente com base na similaridade textual.

    🔗 Fonte da função de similaridade:
    Foi usada a função get_close_matches() da biblioteca padrão difflib do Python.
    Documentação oficial - difflib

  4. Tabela de Símbolos:
    Registra todas as palavras relevantes (exceto stopwords e inválidas) com a contagem de quantas vezes apareceram.

  5. Fila de Tokens:
    Constrói uma fila com todas as palavras e pontuações separadas, na ordem em que apareceram no texto.


▶️ Como Executar

1. Requisitos:

  • Python 3.x instalado
  • Biblioteca nltk instalada

Para instalar o nltk, execute:

pip install nltk

Depois, abra um terminal e execute uma única vez o seguinte código no Python para baixar as stopwords:

import nltk
nltk.download('stopwords')

2. Executar o Programa:

python analisador_lexico.py

Digite uma frase quando solicitado e veja o analisador em ação!


📌 Observações

  • O programa aceita letras do alfabeto latino com acentos (como "á", "é", "ç", etc.).
  • Palavras com caracteres não permitidos serão descartadas e listadas como inválidas.
  • A função de correção (similaridade) está preparada para ser usada, mas requer um dicionário de palavras válidas preenchido.

About

Este projeto é um analisador léxico simples desenvolvido em Python.

Resources

Stars

Watchers

Forks

Releases

Packages

Contributors

Languages