OpenVINO™ 2026.4正式发布!

AI工作负载正在快速演进,开发者对高效、灵活推理能力的需求也前所未有地高涨。从多模态智能助手到实时语音处理流水线,开发者正在构建比以往更加丰富的AI应用,而他们希望运行的模型在种类和能力上也在持续扩展。

OpenVINO™ 2026.4正是在这样的背景下推出。本次版本带来了更多新模型支持、进一步的推理加速优化,以及面向JavaScript开发者的Node.js ASRPipeline支持

无论你是在AI PC上运行生产级工作负载、尝试在NPU上部署最新模型,还是刚刚开始接触OpenVINO™,这一版本都带来了值得关注的新能力。

本文要点

  • 新模型支持
  • 借助MTP和DFlash进一步加速推理流水线
  • Node.js中的ASRPipeline:语音识别

新模型支持

本次发布新增支持了众多模型,覆盖语音、视觉语言、自动语音识别以及图像生成等工作负载。

在CPU上:

Gemma-3n

Gemma-3n由Google DeepMind推出,是Gemma模型家族的最新演进版本,专为高效多模态推理而设计,在模型能力与资源占用之间取得了良好的平衡。

对于希望构建端侧智能助手或视觉语言应用、同时设备内存资源较为有限的开发者而言,Gemma-3n是非常适合的选择。

CPU 和 GPU上:

Kokoro-82M

Kokoro-82M是一款紧凑型文本转语音(TTS)模型,可以用远小于大型TTS系统的模型规模,实现自然流畅的语音合成效果。该模型仅有8200****万参数,非常适合在CPU和GPU上进行实时语音生成,无需承担大型语音模型带来的高额资源开销。

Qwen3-VL-4B with EAGLE 3

Qwen3-VL-4B with EAGLE 3将阿里巴巴的视觉语言模型与EAGLE 3****推测解码组件相结合,可开箱即用地为多模态工作负载提供更快的Token生成速度。

Qwen3-ASR

Qwen3-ASR为Qwen3模型家族引入了自动语音识别能力,为开发者提供了一款性能出色的语音转写模型。借助该模型,开发者可以构建语音转写、实时字幕以及支持语音交互的智能助手等应用。

Gemma 4 12B

Google DeepMind推出的Gemma 4 12B填补了Gemma 4模型家族中的中等规模档位,在模型能力与运行效率之间取得了良好的平衡。该模型拥有120****亿参数,支持文本、图像和音频输入。对于希望获得比轻量级边缘模型更强的推理能力和多模态性能,同时仍需要兼顾本地部署和资源效率的开发者来说,它是一个具有吸引力的选择。

Hy-MT2-1.8B

Hy-MT2-1.8B是一款专为快速多语言推理优化的紧凑型机器翻译模型。其参数规模为18****亿,能够支持广泛语言范围内的专业翻译任务,同时保持较小的部署规模。因此,它非常适合用于本地化工作流、实时翻译功能以及边缘端翻译场景,尤其适用于相比通用大语言模型,更倾向于使用专业翻译模型的应用。

DeepSeek OCR-2

DeepSeek OCR-2为文档理解和光学字符识别(OCR)场景提供了新的模型选择。该模型面向扫描文档、表单、发票以及复杂版面文档的信息提取任务,可以帮助开发者将文档图像转换为可供后续处理和自动化工作流使用的结构化信息。

Granite 4.0 H Micro

IBM推出的Granite 4.0 H Micro是一款紧凑型混合架构语言模型,将Mamba-2Transformer****架构结合起来,以实现高效、低延迟推理。该模型专为智能体工作流和本地****部署而设计,在性能与资源效率之间提供了实用的平衡,非常适合运行在资源受限硬件上的应用。

NPU上:

Kokoro-82M

Kokoro-82M现在进一步支持NPU,使其能够在Intel AI PC上实现更加节能高效的语音合成,而无需承担CPU或GPU推理可能带来的更高内存和功耗开销。

FLUX.2-Klein-4B

Black Forest Labs推出的FLUX.2-Klein-4B将紧凑型图像生成能力带到了NPU,使资源受限设备上的实时图像生成变得更加可行。

首日支持(Day 0 Support)

OpenVINO™持续践行与开源社区和最新模型发展保持同步的承诺。

本次发布为Muse Glimmer(https://www.intel.com/content/www/us/en/developer/articles/community/day-0-local-agentic-ai-with-metas-muse-glimmer.html)和Qwen 3.8 27B(https://medium.com/openvino-toolkit/day-0-support-for-qwen3-8-27b-run-the-new-model-on-intel-agentic-pcs-with-openvino-from-day-one-19ca7a7790e4?sharedUserId=openvino)提供了首日支持(Day 0 Support,让开发者能够在这些模型发布的第一时间,就开始在Intel硬件上进行体验和部署。

除了上述模型之外,还可以访问OpenVINO™ Model Hub,查看更多经过优化、可直接部署的模型以及相关性能测试结果:

https://www.intel.com/content/www/us/en/developer/tools/openvino-toolkit/model-hub.html

借助 MTP 和 DFlash 进一步加速推理流水线

OpenVINO™ GenAI现在已经在CPU和GPU上,为Gemma 4****、Qwen 3.5和****Qwen 3.6提供了Token预测(Multi-Token PredictionMTP投机解码支持。传统的投机解码通常依赖一个独立的轻量级草稿模型(Draft Model)来预测候选Token,再由主模型在一次前向传播中完成验证,从而减少生成完整序列过程中调用主模型的次数。

MTP则采用了不同的方法。

它不再依赖独立的草稿模型,而是利用直接集成在模型内部的预测头(Prediction Heads,一次推测生成多个Token。由于这些预测头与主模型共同训练,因此生成结果通常更加准确,从而能够获得更高的候选Token接受率,并在每次前向传播中确认更多****Token。最终,这意味着在不牺牲输出质量的情况下,可以实现:

  • 更高的推理吞吐量
  • 更低的生成延迟
  • 无需修改现有流水线配置

与此同时,针对Qwen模型的DFlash****加速现在也作为OpenVINO™ GenAI的预览功能,在搭载Intel® Core™ Ultra Series 3****处理器的平台GPU上提供支持。

DFlash将多项GPU优化与面向多模态工作负载的视觉TokenVisual Token)支持结合在一起,可以在同时处理文本和图像输入的GenAI流水线中降低延迟、提升执行速度。

对于构建视觉语言模型(VLM)流水线,或者在Intel GPU上运行Qwen模型的开发者来说,这意味着:

  • 更快的首Token响应时间(Time to First Token,TTFT)
  • 更高的整体推理吞吐量

Node.js 中的 ASRPipeline:语音识别

OpenVINO™ GenAI的ASRPipeline最早在OpenVINO™ 2026.3中推出,为自动语音识别模型提供了统一接口。借助这一接口,开发者无需直接处理不同模型特有的输入输出逻辑,即可更加轻松地将语音转写能力集成到应用中。在OpenVINO™ 2026.4中,这一流水线进一步扩展到了Node.js,从而面向庞大的JavaScript开发者群体开放,使其能够更方便地构建服务器端和桌面端AI应用

Node.js版本支持Whisper****、****Qwen3-ASR等模型,同时提供与C++和Python版本一致的核心能力,包括:

  • 流式语音转写
  • 性能指标统计
  • 简洁统一的Pipeline API
  • 对底层模型处理细节的抽象封装

其中,**流式处理(Streaming)**对于真实语音应用尤其重要。

传统方式往往需要等待完整音频输入完成之后才能返回结果,而流式语音识别则能够在结果生成后立即逐步返回转写内容。

这对于以下场景尤为关键:

  • 实时字幕
  • 语音助手
  • 实时语音交互
  • 任何用户能够明显感知延迟的应用

如果你此前已经在Node.js中使用过其他OpenVINO™ GenAI Pipeline,那么ASRPipeline的使用方式也会非常熟悉。

完整示例可参考:

https://github.com/openvinotoolkit/openvino.genai/blob/releases/2026/4/samples/js/automatic_speech_recognition/README.md

以下是一个示例代码片段:

import { ASRPipeline } from 'openvino-genai-node';
import { readFileSync } from 'node:fs';
import { decode } from 'node-wav';

const pipeline = await ASRPipeline(modelDir, "CPU");
const rawSpeechBuffer = readFileSync(audioFilePath);
const rawSpeech = decode(rawSpeechBuffer).channelData[0];
const result = await pipeline.generate(rawSpeech);
console.log(result.texts[0]);

小结

OpenVINO™ 2026.4在整个AI推理技术栈上都带来了进一步增强。CPU、GPU和NPU上新增的模型支持,进一步拓展了开发者能够构建的应用类型,以及这些应用可以运行的平台范围。MTPDFlash则进一步释放现有硬件上的推理性能,而Node.js ASRPipeline的加入,也让JavaScript开发者能够更加方便地构建语音识别应用。无论你正在部署生产级AI流水线,还是刚刚开始探索OpenVINO™,本次发布都为你在Intel硬件上开发AI应用提供了更多选择和能力。

准备好开始体验了吗?

立即下载OpenVINO™ 2026.4,探索它能够带来的更多可能性。

更多资源

  • OpenVINO™ 2026.3 Documentation :https://docs.openvino.ai/2026/index.html
  • OpenVINO™ Model Hub :https://www.intel.com/content/www/us/en/developer/tools/openvino-toolkit/model-hub.html
  • OpenVINO™ Hugging Face collection : https://huggingface.co/collections/OpenVINO/llms-optimized-for-npu-686e7f0bf7bc184bd71f8ba0
  • AI Reference Kits from Intel : https://www.intel.com/content/www/us/en/developer/topic-technology/edge-5g/open-potential.html
  • OpenVINO™ GenAI : https://github.com/openvinotoolkit/openvino.genai

声明与免责声明

*其他名称和品牌可能是其各自所有者的资产。

性能会因使用方式、配置及其他因素而有所不同。更多信息请参阅Performance Index网站。

性能测试结果基于所示配置及对应日期进行的测试,可能无法反映所有已经公开发布的更新。

没有任何产品或组件能够做到绝对安全。

实际成本和结果可能有所不同。

Logo

为开发者提供丰富的英特尔开发套件资源、创新技术、解决方案与行业活动。欢迎关注!

更多推荐