Manual de anotação como recurso de Processamento de Linguagem Natural

Artigo Acesso aberto

Manual de anotação como recurso de Processamento de Linguagem Natural

2022; UNIVERSIDADE FEDERAL DE UBERLÂNDIA; Volume: 16; Issue: 4 Linguagem: Português

10.14393/dl52-v16n4a2022-13

ISSN

1980-5799

Autores

Magali Sanches Duran, Maria das Graças Volpe Nunes, Lucelene Lopes, Thiago Alexandre Salgueiro Pardo,

Tópico(s)

Linguistic Studies and Language Acquisition

Resumo

Com o avanço da área de Processamento de Linguagem Natural (PLN), corpora são recursos que têm tido um lugar de destaque. Mais do que subsidiar estudos linguísticos, eles constituem as bases para o treinamento de modelos de Aprendizagem de Máquina e para o desenvolvimento de aplicações computacionais de ponta. Particularmente, há grande necessidade de corpora anotados, porém sua geração requer outro recurso essencial, o manual de anotação, que instancia o modelo de anotação de interesse para a língua em questão e delineia as decisões de anotação que devem ser adotadas. Neste artigo, exploramos questões relacionadas ao desenvolvimento de manuais para a anotação de corpus em português brasileiro segundo o modelo internacional Universal Dependencies, amplamente adotado na área. Partimos da discussão da evolução do PLN e o uso de corpora, passamos pelas questões, recursos e ferramentas fundamentais relacionados à representação sintática, discutimos o modelo Universal Dependencies e apresentamos as principais decisões tomadas na instanciação de suas diretrizes no português brasileiro. Por questões práticas e de didática, dividimos o manual em duas partes: o Manual de Anotação de PoS tags (anotação morfossintática) e o Manual de Anotação Relações de Dependência. Ambos foram resultado do processo relatado neste artigo e estão disponíveis para livre acesso no site do projeto POeTiSA na Web.

Ver no editor

Altmetric

PlumX

Entrar

Lembrar minha senha

Receber meu e-mail de confirmação

Manual de anotação como recurso de Processamento de Linguagem Natural