T07Diretriz EQUATORACM_SIGSOFT LLM Guidelines (2024)Onda 2

Estudos Empíricos com LLMs em Engenharia de Software

8 slots de evidência · 8 seções obrigatórias · citação IEEE

Comitê Científico PaperClicTecaless Technologies LTDAPublicado em 27 de agosto de 20261 min de leituraRede EQUATOR
Resumo (NBR 6028)

Escopo da Diretriz

Matriz de relato para estudos empíricos que usam modelos de linguagem como objeto ou instrumento. Cobre versionamento exato do modelo, prompts na íntegra, parâmetros de amostragem, número de repetições, contaminação de dados e custo computacional.

Tipologia
Diretriz Científica
Macro-cluster
Engenharias, Computação e Ciência de Dados
Subcluster
ACM_SIGSOFT LLM Guidelines (2024)
Nível de implementação
Checklist
Público-alvo
Pesquisadores, pós-graduandos e docentes
Rigor
Rede EQUATOR

Diretriz de relato (Rede EQUATOR)

Esta página consolida 8 items de checklist em 8 domínios. Use-a como lista de verificação antes da submissão do manuscrito.
9 seções

Checklist e Domínios da Diretriz

1. Identificação do Modelo

checklist

Registrar nome, versão exata, data de acesso e provedor do modelo.

  • A versão exata do modelo e a data de acesso estão registradas. (LLM Guidelines, reporte do modelo)

2. Prompts e Contexto

checklist

Apresentar os prompts na íntegra e a estratégia de construção de contexto.

  • Os prompts estão disponíveis na íntegra. (LLM Guidelines, prompts)

3. Parâmetros de Amostragem

checklist

Declarar temperatura, top-p, limite de tokens e semente quando aplicável.

  • Os parâmetros de decodificação estão declarados. (LLM Guidelines, configuração)

4. Repetições e Variabilidade

checklist

Informar quantas execuções por item e como a variabilidade foi tratada.

  • O número de repetições por item está informado. (LLM Guidelines, não determinismo)

5. Contaminação de Dados

checklist

Avaliar se o benchmark pode ter sido visto no treinamento do modelo.

  • O risco de contaminação de dados é avaliado. (LLM Guidelines, contaminação)

6. Avaliação e Julgamento

checklist

Descrever a métrica e, se houver julgamento humano ou por modelo, sua confiabilidade.

  • A confiabilidade do julgamento está reportada. (LLM Guidelines, avaliação)

7. Custo e Recursos

checklist

Reportar custo computacional, financeiro e consumo estimado.

  • O custo computacional está reportado. (LLM Guidelines, custo)

8. Artefatos

checklist

Disponibilizar prompts, saídas brutas e scripts de avaliação.

  • As saídas brutas do modelo estão disponíveis. (LLM Guidelines, artefatos)

9. Evidence Gate

warningExclusivo Pro

Este protocolo tem 8 slots de evidência, dos quais 7 são bloqueantes. Um slot bloqueante só é aceito com confiança igual ou superior a 0.85; abaixo disso o item volta ao autor como…

Conteúdo aprofundado disponível para assinantes PaperClic Pro.

Garantir acesso prioritário
Especialistas

Dicas de Especialistas & Alertas de Bancas

📌 Norma de citação: IEEE.
⚠️ 7 itens são bloqueantes — sem eles o trabalho não avança de etapa.
ABNT NBR 6023

Referências Bibliográficas Auditadas

  1. Consulte a diretriz oficial em https://arxiv.org/abs/2411.07668.

    Acessar
✓ Conteúdo original✓ Revisão humana✓ Fontes primárias✓ Autoria declarada

Comitê Científico PaperClic — Tecaless Technologies LTDA. Verificação de originalidade e integridade de citações aplicada.