OPERATOR RULE

MatMul

两个输入都必须使用对称 per-tensor S8 或 S16。

quant-only
规则定位quant-only
量化判定两个数据输入和输出必须量化
数据类型输入 S8 / S16 对称 per-tensor;输出为激活类型
示例状态2/2 PASS

数据类型与量化边界

数据类型概述
输入 S8 / S16 对称 per-tensor;输出为激活类型
量化要求
两个数据输入和输出必须量化

规则原文

规则定位:quant-only

本页是 ax quant spec 的逐算子展开。本页与统一规范冲突时,以统一规范为准。

规则

  • 两个输入都必须使用对称 per-tensor S8 或 S16。
  • 两个输入的整数量化类型必须相同;scalezero_point 可以不同。
  • 输出从通用激活类型中独立选择类型和量化参数,并连接完整 Q/DQ。
  • 静态量化输入可以使用 FP32 initializer 经 Q/DQ,或整数 initializer 经 DQ。

本文档未增加限制的属性、shape 和输入形式,遵循模型声明 opset 下的 ONNX 语义。

MODEL EVIDENCE

可验证的 ONNX 案例

每张卡片直接嵌入对应的 Netron 模型图,进入页面后自动加载。

S8 输入

VERIFIED

两个输入均为对称 per-tensor S8。

errors 0warnings 0nodes 7Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开

S16 输入

VERIFIED

两个输入均为对称 per-tensor S16。

errors 0warnings 0nodes 7Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开