7.2. 智慧办公与交互#
7.2.1. 视讯系统#
KVM / IPKVM:待补充(方案说明与链接)。
7.2.2. AI 会议系统#
一、简介#
本方案提供一套面向 8850N/8850 的会议转录和大模型会议纪要生成的端侧会议处理系统,支持两种使用方式:
浏览器实时会议:浏览器采集麦克风音频,实时分段转录;会议结束后进行完整的说话人聚类、带说话人标注的 ASR 转录,并调用 OpenAI 兼容的大模型服务生成会议纪要。
离线音频导入:上传
wav/flac/mp3/mp4/m4a等音频文件,服务端完成说话人识别和 ASR 转录,再按需生成会议纪要。
本方案为完整的本地会议智能链路:音频采集、VAD 切分、实时转录、说话人识别、完整转写、会议纪要、结果归档都在同一套服务中闭环。
核心能力包括:
VAD:语音活动检测,切分有效语音段。
ASR:基于 SenseVoiceSmall 的多语种语音识别,当前默认中文。
Speaker Embedding:基于 CAM++ 的说话人表征抽取。
Speaker Clustering:基于 spectral/AHC 的说话人聚类。
LLM Summary:通过 OpenAI 兼容接口调用本地或远端大模型生成会议纪要。
这意味着可以把普通会议录音升级为一个本地化、低延迟、可二次开发的会议智能处理入口:
本地语音闭环:VAD、ASR、说话人识别在 AX8850N/8850 上运行,原始音频不必依赖云端 ASR。
会中和会后结合:会中给实时分段字幕,会后输出更完整的说话人标注 transcript。
LLM 可插拔:总结侧走 OpenAI 兼容接口,可接本地大模型服务,也可按业务接其他兼容服务。
结果可追溯:每次会议保存独立转录和摘要文件,便于归档、检索、复测和问题定位。
二、方案优势#
常见问题 |
方案价值 |
|---|---|
只做单段 ASR,无法区分多人会议中是谁在说话 |
通过 CAM++ embedding + spectral/AHC 聚类输出 |
云端 ASR 和云端总结涉及网络、隐私和成本 |
语音识别和说话人识别在板端完成,总结可接本地 OpenAI 兼容 LLM |
实时转录和最终纪要目标不同,单一路径难兼顾 |
实时阶段做低延迟分段显示,会议结束后再跑完整说话人识别和最终 ASR |
产品侧提供二次开发接口 |
FastAPI 提供 WebSocket、上传识别、总结、导出和录音下载接口,便于集成到业务系统 |
三、适用场景#
场景 |
典型需求 |
方案收益 |
|---|---|---|
企业会议、项目例会 |
会中实时字幕,会后生成带说话人的完整记录 |
减少人工整理会议纪要的时间,保留发言上下文 |
访谈、调研、客服质检 |
区分主持人、被访者、客户或坐席 |
便于按说话人追溯原话,支持后续质检和结构化分析 |
培训、课堂、评审 |
长音频转录、重点内容摘要、待办提取 |
输出 transcript 和 summary,便于学员复盘和资料沉淀 |
内网或弱网环境 |
不希望上传音频到云端 ASR |
板端完成核心语音处理,LLM 可选本地服务 |
芯片能力 PoC / 客户演示 |
展示 8850N/8850 上多模型串联、NPU 推理和本地 LLM 联动 |
用真实 Web Demo 展示端侧会议智能闭环 |
行业应用二次开发 |
将会议转写接入知识库、工单、CRM 或审计系统 |
通过 HTTP/WebSocket/Python API 获取转录和纪要结果 |
四、整体流程图#
flowchart TB
A["浏览器麦克风或音频文件"] --> B{"输入方式"}
B -->|"实时会议"| C["采集 / 上传音频"]
B -->|"离线导入"| D["上传音频文件"]
C --> E["实时 VAD + ASR"]
E --> G["完整 Diarization + ASR"]
D --> G
G --> H["说话人聚类 + 完整转录"]
H --> I{"是否启用总结"}
I -->|"启用"| J["OpenAI 兼容 LLM 生成纪要"]
I -->|"禁用"| K["跳过总结"]
J --> L["保存 transcript / summary"]
K --> L
L --> M["清理缓存和临时文件"]
五、规格参数与资源占用#
5.1 芯片能力参考#
以下参数用于说明本方案涉及的能力维度,具体能力以实际芯片型号、SDK 版本、板级设计和镜像版本为准。
项目 |
当前参考 |
对本方案的意义 |
|---|---|---|
SoC / NPU |
提供 24 TOPS @ INT8 的算力 |
承担 VAD、CAM++、SenseVoiceSmall 和本地 LLM 推理 |
CPU |
Arm Linux 环境 |
运行 FastAPI、WebSocket、音频解码、fbank、聚类、文本后处理和 LLM 客户端 |
内存体系 |
系统内存 + CMM 等硬件加速内存池 |
承担 Python 进程、音频缓存、聚类矩阵、ASR metadata、本地 LLM 服务等 |
网络 |
局域网 HTTP/HTTPS + WebSocket |
支撑浏览器访问、音频流上传和 OpenAI 兼容接口调用 |
存储 |
本地文件系统 |
保存 wheel、axmodel、录音临时文件、转录和摘要结果写入 |
5.2 性能参考#
基于AX8850N的板端测试,使用 16kHz 单声道音频,VAD、CAM++、SenseVoiceSmall 的平均延迟和 CMM 占用如下表所示:
模块 |
model |
avg latency |
CMM MiB |
|---|---|---|---|
VAD |
|
|
|
Speaker Embedding |
|
|
|
ASR |
|
|
|
合计 |
- |
|
|
RTF 定义:
RTF = 处理耗时 / 音频时长
测试音频 |
音频时长 |
处理耗时 |
RTF |
|---|---|---|---|
|
|
|
|
|
|
|
|
按 RTF=0.143 估算,1 小时会议音频约需 8.6 分钟完成完整离线说话人识别和 ASR。实时阶段只做已完成片段的快速转录,用户感知延迟主要由 VAD 检测间隔、静音确认时间和 ASR 片段长度决定。