OpenAI compatible API · Attested · Public status
DeepInfra performance
Review measured TTFT, TTFB, effective throughput, uptime, and sampled model routes for DeepInfra on TrustedRouter using metadata-only production probes.
Onebase URL to migrate
100sof models and routes
0prompt or output logs. Always.
DeepInfradeepinfra
45 samplesContinuously sampled provider performance. TrustedRouter reports unsupported route and probe-configuration rows separately from provider downtime. Prompt and output content is not stored.
| p50 TTFT | 1511 ms |
|---|---|
| p95 TTFT | 10757 ms |
| p50 TTFB | 1763 ms |
| Effective throughput | 38 tok/s n=17 |
| Uptime | 97.78% |
Measured model routes
| Model | p50 TTFT | p50 TTFB | Effective throughput | Uptime | Config excluded | Availability samples |
|---|---|---|---|---|---|---|
| qwen/qwen3-14b | 395 ms | 395 ms | — | 100.00% | — | 1 |
| qwen/qwen3-235b-a22b-thinking-2507 | 514 ms | 513 ms | — | 100.00% | — | 2 |
| microsoft/phi-4 | 589 ms | 589 ms | — | 100.00% | — | 1 |
| nousresearch/hermes-3-llama-3.1-405b | 757 ms | 757 ms | — | 100.00% | — | 1 |
| meta-llama/llama-3.1-70b-instruct | 850 ms | 850 ms | — | 100.00% | — | 1 |
| moonshotai/kimi-k2.5 | 993 ms | 993 ms | — | 100.00% | — | 2 |
| minimax/minimax-m3 | 1022 ms | 1022 ms | 22 tok/s n=1 | 100.00% | — | 3 |
| thinkingmachines/inkling | 1314 ms | 1314 ms | 38 tok/s n=2 | 100.00% | — | 1 |
| z-ai/glm-4.7 | 1327 ms | 1327 ms | — | 100.00% | — | 1 |
| qwen/qwen3.5-397b-a17b | 1358 ms | 1358 ms | — | 100.00% | — | 1 |
| mistralai/mistral-small-24b-instruct-2501 | 1370 ms | 1370 ms | — | 100.00% | — | 1 |
| qwen/qwen3.5-35b-a3b | 1390 ms | 1390 ms | — | 100.00% | — | 1 |
| google/gemma-3-4b-it | 1391 ms | 1391 ms | — | 100.00% | — | 1 |
| google/gemma-4-26b-a4b-it | 1411 ms | 1411 ms | — | 100.00% | — | 3 |
| qwen/qwen3-30b-a3b | 1447 ms | 1446 ms | — | 100.00% | — | 1 |
| z-ai/glm-4.6 | 1511 ms | 1511 ms | — | 100.00% | — | 2 |
| google/gemma-3-27b-it | 1681 ms | 1681 ms | — | 100.00% | — | 1 |
| deepseek/deepseek-v4-pro | 1757 ms | 1757 ms | 97 tok/s n=1 | 100.00% | — | 1 |
| deepseek/deepseek-v3.1-terminus | 1987 ms | 1987 ms | — | 100.00% | — | 1 |
| openai/gpt-oss-20b | 2578 ms | 2578 ms | — | 100.00% | — | 1 |
| nvidia/nemotron-3-nano-30b-a3b | 2625 ms | 2625 ms | — | 100.00% | — | 2 |
| deepseek/deepseek-v4-flash-0731 | 2659 ms | 2659 ms | 73 tok/s n=2 | 100.00% | — | 2 |
| qwen/qwen3-next-80b-a3b-instruct | 2760 ms | 2759 ms | — | 100.00% | — | 1 |
| qwen/qwen3.6-27b | 2866 ms | 2865 ms | — | 100.00% | — | 1 |
| google/gemini-3.1-flash-lite | 2969 ms | 2969 ms | — | 100.00% | — | 2 |
| google/gemma-4-31b-it | 3807 ms | 3807 ms | 14 tok/s n=1 | 100.00% | — | 2 |
| qwen/qwen3.6-35b-a3b | 3817 ms | 3817 ms | — | 100.00% | — | 3 |
| z-ai/glm-4.7-flash | 4655 ms | 4655 ms | — | 100.00% | — | 1 |
| tencent/hy3 | 5790 ms | 5790 ms | 40 tok/s n=2 | 100.00% | — | 1 |
| z-ai/glm-5.2 | 27546 ms | 27546 ms | 34 tok/s n=1 | 100.00% | — | 1 |
| deepseek/deepseek-v3.2 | — | — | — | 100.00% | — | 1 |
| deepseek/deepseek-v4-flash | — | — | 41 tok/s n=1 | — | — | 0 |
| moonshotai/kimi-k2.6 | — | — | 27 tok/s n=2 | — | — | 0 |
| openai/gpt-oss-120b | — | — | 37 tok/s n=2 | 0.00% | — | 1 |
| thinkingmachines/inkling-small | — | — | 74 tok/s n=2 | — | — | 0 |