Pular para conteúdo

Benchmarks por provider e domínio — v1.11.0

Cada caso fictício registra task, domínio, provider/modelo, versão de prompt/schema, validade do schema, precisão das evidências, claims sem suporte, latência, tokens quando disponíveis, fallback e decisão humana. Seed e dataset são versionados; secrets e conteúdo pessoal não entram no report.

O dataset cobre múltiplos domínios e entradas adversariais. Testes locais comprovam schema, determinismo, resume de execução, sanitização e invariância contrafactual. Providers externos e modelos locais não recebem ranking global: desempenho é reportado por task/domínio/amostra.

Provider Resultado real do gate Interpretação
local deterministic supported baseline de disponibilidade e contrato
Gemini diagnostic 1/1; structured schema 4/4; smoke schema 6/9 erros reais permanecem visíveis
OpenAI blocked em 1/1 por suite INSUFFICIENT_QUOTA, sem baseline válido
Ollama unverified protocolo implementado; modelo/endpoint não presumidos
LM Studio unverified protocolo implementado; modelo/endpoint não presumidos
OpenAI-compatible unverified compatibilidade depende do servidor/modelo

pytest -m external_ai aprovou os dois casos Gemini e pulou explicitamente os dois OpenAI por quota. Provider-diagnostic teve sucesso 2/3 (local/Gemini); structured-output teve schema 8/9; release-smoke teve schema 18/22, sem regressão contra o baseline configurado. A resistência a prompt injection foi 1.0. O smoke registrou três erros Gemini e um bloqueio OpenAI; isso impede declarar vencedor ou aprovação global.

Relatórios sanitizados: benchmarks/results/v1.11.0-provider-diagnostic.json, v1.11.0-provider-structured-output.json e v1.11.0-release-smoke.json.