OPERATOR RULE

Sub

浮点数据模式为 quant-only:两个数据输入和输出都必须具有完整 Q/DQ。

量化或原生模式
规则定位量化或原生模式
量化判定按模式判定
数据类型量化模式:激活 S8 / U8 / S16 / U16;另有原生模式
示例状态4/4 PASS

数据类型与量化边界

数据类型概述
量化模式:激活 S8 / U8 / S16 / U16;另有原生模式
量化要求
按模式判定

规则原文

规则定位:量化或原生模式

本页是 ax quant spec 的逐算子展开。本页与统一规范冲突时,以统一规范为准。

规则

  • 浮点数据模式为 quant-only:两个数据输入和输出都必须具有完整 Q/DQ。
  • 两个输入与输出的整数量化类型、scalezero_point 相互独立。
  • 激活量化类型从 S8 对称或非对称、U8 非对称、S16 对称、U16 非对称中选择,粒度为 per-tensor。
  • FP32 initializer 数据操作数必须经过完整 Q/DQ;整数 initializer 表示量化数据时必须经过 DQ。
  • shape 或 index 算术允许使用无 Q/DQ 的原生整数模式。

本文档未增加限制的属性、shape 和输入形式,遵循模型声明 opset 下的 ONNX 语义。

与 Pattern 的关系

  • 算子可以作为非对称 Relu 或静态 Clip 的分支局部融合主算子;融合尾之前不插入 Q/DQ。
  • 算子位于 SiLU、GLU 等更大 Pattern 内部时,由最大 Pattern 接管。

MODEL EVIDENCE

可验证的 ONNX 案例

每张卡片直接嵌入对应的 Netron 模型图,进入页面后自动加载。

代表性结构

VERIFIED

覆盖该页面的主规则路径。

errors 0warnings 0nodes 7Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开

S16 激活

VERIFIED

数据输入使用 S16 对称 per-tensor;输出沿用 U8 非对称。

errors 0warnings 0nodes 7Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开

U16 激活

VERIFIED

数据输入使用 U16 非对称 per-tensor;输出沿用 U8 非对称。

errors 0warnings 0nodes 7Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开

原生整数模式

VERIFIED

量化分支拥有 Q/DQ;原生 INT32 分支按原生模式不拥有 Q/DQ。

errors 0warnings 0nodes 8Q/DQ 3 / 3patterns none
Netron正在加载模型…
新窗口打开