<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Inference-Performance on Kuldeep Pisda</title><link>https://kdpisda.in/tag/inference-performance/</link><description>Recent content in Inference-Performance on Kuldeep Pisda</description><generator>Hugo</generator><language>en-us</language><lastBuildDate>Thu, 10 Sep 2026 09:00:00 +0530</lastBuildDate><atom:link href="https://kdpisda.in/tag/inference-performance/index.xml" rel="self" type="application/rss+xml"/><item><title>Mercury 2.5: When an LLM Stops Writing One Token at a Time</title><link>https://kdpisda.in/mercury-2-5-diffusion-llm-parallel-token-generation/</link><pubDate>Thu, 10 Sep 2026 09:00:00 +0530</pubDate><guid>https://kdpisda.in/mercury-2-5-diffusion-llm-parallel-token-generation/</guid><description>&lt;p&gt;Every major model you&amp;rsquo;ve used, GPT, Claude, Gemini, Llama, writes one token at a time, left to right, each one conditioned on everything before it. That&amp;rsquo;s why streaming responses trickle out word by word. Inception Labs just shipped Mercury 2.5, a diffusion language model that throws that constraint out, generating a whole block of text in parallel and iteratively refining it, and it&amp;rsquo;s now running at over 1,100 tokens per second on widely available Nvidia GPUs. That&amp;rsquo;s not a marginal speedup. It&amp;rsquo;s a different generation mechanism reaching a point where the intelligence gap with autoregressive models has closed enough to matter for real workloads.&lt;/p&gt;</description></item></channel></rss>