Simulação de Diálogos e Personagens no ChatGPT-4
Análise Comparativa do Desempenho em Idiomas Inglês e Português
Fabiano Rodrigues de Souza (primeiro autor),
Denise da Vinha Ricieri, Raphaela V. G. Barreto, Adriana M. G. de Farias
·
CoBICET 2023 â IV Congresso Brasileiro Interdisciplinar em Ciência e Tecnologia, Online, agoâset 2023
·
Trabalho completo revisado por pares
Pergunta de pesquisa
Como a qualidade das respostas do GPT-4 difere entre inglês e português sob um
prompt estruturado idêntico â e qual mecanismo explica essa diferença?
Metodologia
- Sujeito: GPT-4 (LLM
code-davinci-003) acessado via ChatGPT, abril de 2023, conta geolocalizada nos EUA.
- Classe de prompt: Aprendizagem em Contexto (ICL) â escolhida para alavancar o contexto do prompt em vez de depender apenas da generalização do pré-treino.
- Estrutura do prompt (framework Prompt-EDU): três componentes â contexto · finalidade da generalização · chave de comando.
- Tarefa: diálogo simulado entre Paulo Freire (educador brasileiro) e Mark Zuckerberg (CEO da Meta) sobre IA na educação â selecionados para controlar equilÃbrio cultural-de-dados, generalização cross-domÃnio e reconhecimento pré-cutoff.
- Condições: mesmo prompt aplicado em PT-BR e EN-US; validação por tradução cruzada via o próprio GPT-4; reanálise após tradução.
- Dimensões analÃticas: conteúdo (substância, detalhe) · contexto (fidelidade ao escopo) · linguagem (vocabulário, complexidade).
Achados principais
- Respostas em inglês mensuravelmente mais ricas em detalhe e escopo referencial que em português, sob prompts idênticos.
- Respostas em português concisas e rasas â apenas o essencial, com menor diversidade de vocabulário.
- Preservação de contexto robusta nos dois idiomas â a estrutura ICL generalizou o enquadramento com sucesso através da tradução.
- Causa raiz traceada ao pré-treino dominado pelo inglês e a um pipeline oculto de dupla tradução para prompts em outros idiomas.
- à necessária engenharia de prompt mais forte e sistematizada no idioma nativo para implantações em idiomas não-ingleses.
- Achados mapeados na taxonomia de 5 fontes de viés em NLP de Hovy & Prabhumoye (dados, anotação, representação de entrada, modelos, desenho de tarefa).
Implicações práticas
Qualquer organização que implante LLMs em mercados não-ingleses precisa de (1) engenharia de prompt sistemática no idioma nativo, (2) pipelines explÃcitos de avaliação multilÃngue e (3) revisão humana das saÃdas do modelo.
Educadores que integram IA em experiências de aprendizagem devem desenvolver letramento em IA, competência estruturada em design de prompts e consciência sobre o viés induzido pela tradução antes de confiar em conteúdos gerados por LLM.
O artigo conclui: o próprio ChatGPT reconhece que suas respostas não são 100% confiáveis e exigem revisão humana.
Conceitos técnicos abordados
IA & NLP:
LLM GPT-4 Transformer Mecanismo de Atenção Tokenização Embeddings Decodificação Autorregressiva NLP NLP MultilÃngue Viés de Tradução Alucinação
Prompting & Métodos:
Aprendizagem em Contexto (ICL) Engenharia de Prompt Framework Prompt-EDU Fine-tuning Avaliação MultilÃngue
Educação & Ãtica:
IA na Educação Taxonomia de Bloom Humano no Loop IA Responsável Equidade em IA Design Instrucional
Referências selecionadas (lista completa no artigo original)
Vaswani et al., Attention is all you need (2017) ·
Liu et al., Pre-train, prompt, and predict (2023, ACM Comp. Surv.) ·
Wang et al., LLMs are implicitly topic models (arXiv 2301.11916) ·
Liang et al., GPT detectors are biased against non-native English writers (arXiv 2304.02819) ·
Hovy & Prabhumoye (2021) sobre fontes de viés em NLP ·
Kasneci et al., ChatGPT for good? (Learning & Individual Differences, 2023) ·
OpenAI Inc., GPT-4 Technical Report (arXiv 2303.08774, 2023).