Sonic-Voice V2.5 大模型正式开源

专为苹果生态深度定制的
端侧端到端语音大模型

借鉴 OpenAI Whisper 与 NVIDIA Riva 的前沿架构。我们面向 Mac Studio、Mac mini 及 iOS 终端重构了端侧语音识别与理解管道,为全球苹果开发者提供极速、低延迟、高精度的本地化多模态交互体验。

sonic-ai / sonic-voice-coreml
342
14,802
914
# 安装依赖与 CoreML 加载器
$ pip install sonic-voice-engine
$ python -m sonic_voice.download --model 7B-preview

# 正在加载 Apple Silicon 神经引擎加速...
[SUCCESS] ANE (Apple Neural Engine) Connected.
[ACTIVE] Audio Stream Monitoring on 'Built-in Mic'
import sonic_voice as sv

# 自动编译并绑定本地 CoreML 管道
model = sv.LoadModel("sonic-7b-v2.5", compute_units="all")
stream = sv.AudioStream(device_id=0)

for token in model.generate_stream(stream):
    print(token.text, end="", flush=True)

尖端技术架构

实时音频流矩阵

集成多路并发音频采样,毫秒级流式输入感知。结合 VAD(语音活动检测)过滤环境噪音,在嘈杂的生产环境下依然能保持极高唤醒及听写率。

Apple Silicon 神经网络原生加速

不同于通用的云端模型,SonicLLM 专为苹果 M系列与 A系列芯片重构。算力直接下沉至 ANE(苹果神经网络引擎),大幅释放 macOS/iOS 的 GPU 与 CPU 算力负载,实现极致能效比。

Apple Neural Engine (ANE) Active
CoreML Weights Unified Mapping: 16-bit Quantized

端侧推理时延 (Latency)

在 Mac mini (M4) 平台本地运行,对比标准端侧模型的首字响应速度(WER低于3.2%)。

SonicLLM-7B 0.08s
Whisper-Large-V3 0.38s

端到端意图理解

超越纯粹的文本转写。SonicLLM 能够直接通过声学特征感知说话人情绪、环境语境,并一步到位输出结构化的业务意图(Intent Parsing)。

交付与授权矩阵

Apache-2.0 开源社区版

FREE / OPEN SOURCE
  • 提供完整 3B / 7B 预训练模型权重
  • 基础 CoreML 编译转换脚本
  • GitHub 社区共享与 PR 提交
  • 允许中小型项目免费商业外包与集成

苹果生态专属商业私有化

ENTERPRISE ARCHITECTURE
  • 针对特定业务场景独家定制专属语音大模型
  • 优化特定 iOS 硬件功耗与全场景离线运行策略
  • 提供企业级无缝双机高可用(Mac Studio/Mac mini集群)
  • 资深架构师一对一代码级端侧管道集成支持