7 IQx ultra fast + 26 Token Factory models, all liveExplore

All 33 models.
One API.

IQx ultra fast UltraFast (7) on LPU silicon, plus the full IQx Token Factory catalog (26) on H100 — reasoning, vision, embeddings, and open-weight chat — all through a single OpenAI-compatible interface.

33
Models in catalog
1,800
Max TPS
262K
Max context
/ Compare

Flagship models, side by side.

The numbers that matter: TPS, context, and price. Find the right model for your workload.

ModelTypePlatformContextMax TPSInput / MOutput / M
GPT OSS 20B 128k
UltraFast · MoEIQx ultra fast · OpenAI128K1,800$0.09$0.36
GPT OSS Safeguard 20B
UltraFast · MoEIQx ultra fast · OpenAI128K1,800$0.09$0.36
GPT OSS 120B 128k
UltraFast · MoEIQx ultra fast · OpenAI128K1,000$0.18$0.72
Llama 4 Scout (17Bx16E) 128k
UltraFast · MoEIQx ultra fast · Meta128K1,200$0.13$0.41
Qwen3 32B 131k
UltraFastIQx ultra fast · Alibaba131K1,300$0.35$0.71
Llama 3.3 70B Versatile 128k
UltraFastIQx ultra fast · Meta128K1,100$0.71$0.95
Llama 3.1 8B Instant 128k
UltraFastIQx ultra fast · Meta128K1,800$0.06$0.10
Nemotron-3-Ultra-550B-a55b
Reasoning · MoE 550B (55B active)NVIDIA · Token Factory128K59$1.20$3.60
Cosmos3-Super-Reasoner
Reasoning · VisionNVIDIA · Token Factory128K30$0.12$0.36
openbmb/MiniCPM-V-4.5
Reasoning · VisionOpenBMB · Token Factory32K49.5$0.07$0.13
Kimi-K2.6
Reasoning · multimodal agenticMoonshot AI · Token Factory256K60$1.14$4.80
DeepSeek-V4-Pro
Reasoning · long-horizon agentDeepSeek · Token Factory128K24$2.10$4.20
GLM-5.1
Reasoning · multimodalZ.ai · Token Factory200K25$1.68$5.28
Qwen3.5-397B-A17B
Reasoning · MoE 397B (17B active)Alibaba · Token Factory262K80$0.72$4.32
GLM-5
Reasoning · multimodalZ.ai · Token Factory200K47$1.20$3.84
Hermes-4-405B
Reasoning · verified-CoTNousResearch · Token Factory128K20$1.20$3.60
Hermes-4-70B
ReasoningNousResearch · Token Factory128K20$0.16$0.48
INTELLECT-3
Reasoning · MoE 100B+ RL-tunedPrime Intellect · Token Factory128K35$0.24$1.20
Qwen3-Next-80B-A3B-Thinking
Reasoning · thinking-tuned MoEAlibaba · Token Factory262K85$0.18$1.44
Llama-3.1-Nemotron-Ultra-253B-v1
Reasoning · enterpriseNVIDIA · Token Factory128K25$0.72$2.16
Nemotron-3-Nano-Omni
Open · error-modal reasoningNVIDIA · Token Factory256K90$0.07$0.29
MiniMax-M2.5
Open · agentic codingMiniMax · Token Factory192K36.8$0.36$1.44
Nemotron-3-Super-120b-a12b
Open · MoE 120B (12B active)NVIDIA · Token Factory128K127$0.36$1.08
DeepSeek-V3.2
Open · efficient reasoningDeepSeek · Token Factory128K71$0.36$0.54
gpt-oss-120b
Open · agentic MoEOpenAI · Token Factory128K40$0.18$0.72
Qwen3-235B-A22B-Instruct-2507
Open · MoE 235B (22B active)Alibaba · Token Factory262K27$0.24$0.72
Qwen3-30B-A3B-Instruct-2507
Open · MoE 30B (3B active)Alibaba · Token Factory32K70$0.12$0.36
Qwen3-32B
Open · general 32BAlibaba · Token Factory32K23$0.12$0.36
Gemma-3-27b-it
Open · mid-size instructGoogle · Token Factory32K20$0.12$0.36
Nemotron-3-Nano-30B-A3B
Open · MoE 30B (3B active)NVIDIA · Token Factory256K60$0.07$0.29
Llama-3.3-70B-Instruct
Open · 70B instructMeta · Token Factory128K25$0.16$0.48
Qwen2.5-VL-72B-Instruct
Vision · 72B multimodalAlibaba · Token Factory128K20$0.30$0.90
Qwen3-Embedding-8B
Embeddings · 4096-dimAlibaba · Token Factory32K$0.01

Pick a plan.
Start in 30 seconds.

One API key across all 33 models. From $3 one-time, $25/mo with a 5-hour window. 2 months free on annual.