OpenAI's Jalapeño Chip Beats Rivals on Power and Latency
OpenAI's first custom inference chip delivered 1.5–1.9× more AI work per watt and up to 3.6× lower latency on InferenceX benchmarks, with deployment planned by year-end.
Topic
Topic
OpenAI's first custom inference chip delivered 1.5–1.9× more AI work per watt and up to 3.6× lower latency on InferenceX benchmarks, with deployment planned by year-end.