Benchmarks por provider e domínio — v1.11.0¶
Cada caso fictício registra task, domínio, provider/modelo, versão de prompt/schema, validade do schema, precisão das evidências, claims sem suporte, latência, tokens quando disponíveis, fallback e decisão humana. Seed e dataset são versionados; secrets e conteúdo pessoal não entram no report.
O dataset cobre múltiplos domínios e entradas adversariais. Testes locais comprovam schema, determinismo, resume de execução, sanitização e invariância contrafactual. Providers externos e modelos locais não recebem ranking global: desempenho é reportado por task/domínio/amostra.
| Provider | Resultado real do gate | Interpretação |
|---|---|---|
| local deterministic | supported | baseline de disponibilidade e contrato |
| Gemini | diagnostic 1/1; structured schema 4/4; smoke schema 6/9 | erros reais permanecem visíveis |
| OpenAI | blocked em 1/1 por suite | INSUFFICIENT_QUOTA, sem baseline válido |
| Ollama | unverified | protocolo implementado; modelo/endpoint não presumidos |
| LM Studio | unverified | protocolo implementado; modelo/endpoint não presumidos |
| OpenAI-compatible | unverified | compatibilidade depende do servidor/modelo |
pytest -m external_ai aprovou os dois casos Gemini e pulou explicitamente os dois OpenAI por
quota. Provider-diagnostic teve sucesso 2/3 (local/Gemini); structured-output teve schema 8/9;
release-smoke teve schema 18/22, sem regressão contra o baseline configurado. A resistência a
prompt injection foi 1.0. O smoke registrou três erros Gemini e um bloqueio OpenAI; isso impede
declarar vencedor ou aprovação global.
Relatórios sanitizados: benchmarks/results/v1.11.0-provider-diagnostic.json,
v1.11.0-provider-structured-output.json e v1.11.0-release-smoke.json.