Qualcomm
含有标签 "Qualcomm".
QNN W8A16 的 INT32 Bias Overflow:从极小 Scale 到稳定部署
记录 QNN HTP W8A16 中 INT32 bias 溢出的根因、公式、QueOpt 修复方式,以及在真实板端的验证结果。
QAIRT 2.42 适配 Streaming Spatial Speech Enhancement Network 的 GRU
Streaming Spatial Speech Enhancement Network 的 HTP 部署排查:GRU 展开、长序列 native cell、QAIRT 源码开关、Einsum layout bug 与流式 I/O 对齐。
llama.cpp Hexagon HTP 长 Prompt 默认 ubatch=512 卡住的定位与修复
本来只是想在 Hexagon HTP 上跑一条稍长一点的总结题,结果 `llama.cpp` 默认 `ubatch=512` 直接卡在 prefill。最后一路排到 HMX matmul,发现是小 remainder batch 走异步 pipeline 后没回来。
llama.cpp 里的 lm-head:Q6_K、Q4_0,以及为什么 4B 不一定提速
从 Qwen3/Qwen3.5 的 tied embedding 看 lm-head 性能瓶颈:0.6B 改 output-q4_0 有收益,4B 上收益有限甚至可能变慢。
llama.cpp HTP 调优:少用 CPU 为什么反而慢
用 Qwen3-0.6B 的 profile 解释一个朴素误区:减少 CPU 参与不等于更快。HTP attention、SET_ROWS、图切分和真实 token/s 的关系。
llama.cpp 跑 Qwen3-0.6B:HTP 上从 20 到 70 token/s
一次 Snapdragon Hexagon HTP 上的真实调优记录:OPPOLL、算子过滤、lm-head 量化,以及为什么 70 token/s 不是“全上 NPU”跑出来的。