Proposta de um sistema de transcrição baseado em large language model para geração de atas
| dc.contributor.advisor | Rego, Rosana Cibely Batista | |
| dc.contributor.advisormail | rosana.rego@ufersa.edu.br | |
| dc.contributor.author | Lima, João Gustavo Souza | |
| dc.contributor.referee1 | Rego, Rosana Cibely Batista | |
| dc.contributor.referee2 | Silva, Walber José Adriano | |
| dc.contributor.referee3 | Chagas, José Ferdinandy Silva | |
| dc.coverage.spatial | Pau dos Ferros | |
| dc.date.accessioned | 2026-07-06T16:17:51Z | |
| dc.date.available | 2026-07-06T16:17:51Z | |
| dc.date.issued | 2026-06-10 | |
| dc.description.abstract | O crescimento do uso de plataformas de videoconferência em ambientes institucionais e organizacionais intensificou a necessidade de soluções que automatizem o registro formal de reuniões. A elaboração manual de atas demanda tempo considerável e está sujeita a inconsistências decorrentes de falhas humanas, comprometendo a confiabilidade e a padronização documental. Este trabalho propõe um sistema integrado de transcrição automática e aprimoramento textual voltado à geração automatizada de atas de reuniões em língua portuguesa brasileira. A arquitetura do sistema é composta por três etapas principais: pré-processamento do sinal de áudio com supressão de ruído e conversão para o formato WAV; transcrição automática utilizando o modelo Whisper da OpenAI, executado localmente; e refinamento textual assistido pelo modelo de linguagem de grande escala DeepSeek-R1, acessado via API, por meio de técnicas de engenharia de prompt. O sistema foi implementado como uma API REST utilizando Python e o framework Django REST framework, com interface desenvolvida em React. Para validação experimental, foram utilizados vídeos de reuniões administrativas públicas da UFERSA, o desempenho dos modelos de transcrição foram avaliados pela métrica Word Error Rate (WER), enquanto a qualidade do refinamento textual foi medida pelas métricas ROUGE-L, SBERT e Perplexity. Os resultados indicaram que o modelo Whisper turbo obteve o melhor desempenho, com WER médio de 0,178, enquanto a estratégia de Engenharia de Prompt Automático (APE - Automatic Prompt Engineering) superou a abordagem few-shot no refinamento textual, alcançando ROUGE-L médio de 0,67 e SBERT de 0,95. O sistema demonstrou capacidade de corrigir erros ortográficos e gramaticais, remover disfluências típicas da fala espontânea e estruturar o conteúdo em formato documental adequado ao padrão institucional de atas, sendo disponibilizado ao usuário final como documento DOCX. | |
| dc.description.abstract2 | The increasing use of video conferencing platforms in institutional and organizational environments has intensified the need for solutions that automate the formal recording of meetings. Manually drafting minutes is time-consuming and subject to inconsistencies due to human error, compromising reliability and document standardization. This work proposes an integrated system for automatic transcription and text enhancement aimed at the automated generation of meeting minutes in Brazilian Portuguese. The system architecture consists of three main stages: audio signal pre-processing with noise suppression and conversion to WAV format; automatic transcription using the OpenAI Whisper model, executed locally; and text refinement assisted by the DeepSeek-R1 large-scale language model, accessed via API, using prompt engineering techniques. The system was implemented as a REST API using Python and the Django REST framework, with an interface developed in React. For experimental validation, videos of publicadministrative meetings at UFERSA were used. The performance of the transcription models was evaluated using the Word Error Rate (WER) metric, while the quality of text refinement was measured using the ROUGE-L, SBERT, and Perplexity metrics. The results indicated that the Whisper Turbo model obtained the best performance, with an average WER of 0.178, while the Automatic Prompt Engineering (APE) strategy outperformed the few-shot approach in text refinement, achieving an average ROUGE-L of 0.67 and an SBERT of 0.95. The system demonstrated the ability to correct spelling and grammatical errors, remove disfluencies typical of spontaneous speech, and structure the content in a document format suitable to the institutional standard for minutes, being made available to the end user as a DOCX document. | |
| dc.description.physical | 68 f. | |
| dc.format.mimetype | ||
| dc.identifier.advisorLattes | http://lattes.cnpq.br/2921962829806332 | |
| dc.identifier.advisorOrcid | https://orcid.org/0000-0001-5997-1221 | |
| dc.identifier.authorLattes | http://lattes.cnpq.br/6349836130707865 | |
| dc.identifier.bibliographicCitation | LIMA, João Gustavo Souza. Proposta de um sistema de transcrição baseado em large language model para geração de atas. 68 f. 2026. Monografia (Bacharelado Interdisciplinar em Tecnologia da Informação) – Centro Multidisciplinar de Pau dos Ferros, Universidade Federal Rural do Semi-Árido, Pau dos Ferros, 2026. | |
| dc.identifier.uri | https://repositorio.ufersa.edu.br/handle/prefix/15360 | |
| dc.language.iso | pt_BR | |
| dc.publisher.center | Centro Multidisciplinar de Pau dos Ferros - CMPF | |
| dc.publisher.country | Brasil | |
| dc.publisher.department | Departamento de Engenharias e Tecnologia - DETEC | |
| dc.publisher.initials | UFERSA | |
| dc.publisher.institution | Universidade Federal Rural do Semi-Árido | |
| dc.rights | info:eu-repo/semantics/openAccess | |
| dc.rights.holder | UFERSA | |
| dc.rights.license | Attribution-ShareAlike 3.0 Brazil | en |
| dc.rights.uri | http://creativecommons.org/licenses/by-sa/3.0/br/ | |
| dc.subject.cnpq | CIENCIAS EXATAS E DA TERRA::TECNOLOGIA DA INFORMACAO | |
| dc.subject.keyword | Reconhecimento automático de fala | |
| dc.subject.keyword | Grandes modelos de linguagem | |
| dc.subject.keyword | Engenharia de prompts | |
| dc.subject.keyword | Whisper | |
| dc.subject.keyword | Geração de atas de reunião. | |
| dc.subject.keyword | Automatic speech recognition | |
| dc.subject.keyword | Large Language models | |
| dc.subject.keyword | Prompt engineering | |
| dc.subject.keyword | Whisper | |
| dc.subject.keyword | Meeting minutes generation | |
| dc.title | Proposta de um sistema de transcrição baseado em large language model para geração de atas | |
| dc.title.alternative | Proposal for a large language model-based transcription system for generating meeting minutes | |
| dc.type | info:eu-repo/semantics/bachelorThesis |
