FastFlowLM FastFlowLM
Models Benchmarks
Team News
Docs
Models Benchmarks
Team News
Docs
GitHub Discord YouTube Email

Docs

Benchmarks

Overview
Install-Windows
Install-Linux

Instructions

Overview Sys Command and CLI Mode Server Mode Server Basics API / Client Usage Open WebUI Tool Calling LangChain RAG LangChain Web Search Obsidian Microsoft AI Toolkit

Models

Overview LLaMA DeepSeek Qwen Gemma MedGemma TranslateGemma gpt-oss LiquidAI/LFM Microsoft/Phi Nanbeige Whisper EmbeddingGemma

Benchmarks

Overview LLaMA3 Gemma3 Gemma4 Qwen2.5 Qwen3 Qwen3.5 Qwen3.6 gpt-oss LiquidAI/LFM2 Microsoft/Phi4 Nanbeige4.1

📊 Benchmarks Overview

Browse detailed NPU benchmark results for each major model family supported by FastFlowLM:

  • LLaMA3
  • Gemma3
  • Gemma4
  • Qwen2.5
  • Qwen3
  • Qwen3.5
  • Qwen3.6
  • gpt-oss
  • LiquidAI/LFM2
  • Microsoft/Phi4
  • Nanbeige4.1

Each page includes decoding and prefill speed metrics (tokens per second) and notes about the test setup and hardware.

FastFlowLM The leading LLM inference runtime for parallel NPU architectures

© 2026 FastFlowLM. All rights reserved.

Site

Technology Company Docs

Connect

GitHub Discord YouTube Email