EcoCompute · Notes

quantenergy.tech 中文使用说明(手机查阅版)

2026-08-16 · Hongping Zhang · 中文 / Chinese-language site guide

EcoCompute 一句话定位:别的量化工具教你「怎么量化」,这个网站告诉你「该不该量化」。它用真实 GPU 功耗测量(NVML 直采,不是 TDP 估算)回答一个问题:量化到底省电还是更费电?

预印本:Weight-Only Quantization Does Not Always Save EnergySSRN #6854700)。

先说清楚测量边界(本页所有数字都适用):我们采集的是 GPU 芯片(package)功耗,不是整机墙上功耗——不含电源损耗、CPU、内存、散热,也不换算 PUE 或 CO₂e;工况是 单流解码、batch 1、256 token。重复次数逐点标注:主数据集是 n = 2(CV < 2%),RTX 4090 深挖是每个配置 n = 1。详见 方法与局限

0 · 30 秒上手

  1. 想看别人测过的数据 → 点「已测模型」标签。
  2. 想知道你自己的模型量化后能耗怎么变 → 点「你的模型」标签,拖一下滑块。
  3. 想在给定的延迟/显存上限下找最优配置 → 点「优化(约束)」标签。
  4. 想在自己的 GPU 上复现测量 → 点「自己跑」标签,一行命令。

1 · 顶部栏(Hero)

2 · 标签一:已测模型(Tested models)

功能:看「已经测过」的真实数据,判断某个 GPU + 模型上量化到底是省电还是费电。

这一列的关键发现(Δ 全部由能量列重算,见下方「更正说明」):

模型NF4 vs FP16INT8 vs FP16
Qwen2-0.5B+35.6%+241.9%
TinyLlama-1.1B+16.3%+146.1%
Qwen2-1.5B+15.1%+180.7%
Qwen2.5-3B+0.8%+134.8%
Qwen2-7B−28.5%+49.5%
更正说明(2026-08-11):该 Zenodo 记录 v1 的 vs_fp16_pct 一列与它自己的能量/功率/吞吐列对不上(最严重的是 Qwen2.5-3B NF4:列里写 +10.1%,能量算出来是 +0.8%)。测量值本身没有改变,站点的 measured.csv 与所有曲线一直都是从能量列推导的;上表也已按能量列重算。修正版 Zenodo 记录待发布,详见 那篇 4090 笔记

3 · 标签二:你的模型(Your model / 估算)

功能:输入你关心的模型规模,估算量化后的能耗变化与不确定性。

4 · 标签三:优化(约束)(Optimize)

功能:从「静态查询」升级到「带约束的优化」——在预算内找最优配置。

5 · 标签四:自己跑(Run it yourself)

功能:在自己的 GPU 上复现测量,把结果叠加到站点的交叉曲线上。详见 容器页

6 · About 弹窗

7 · 页脚与博客

8 · 手机上最该记住的 4 条「诚实声明」

  1. 量化 ≠ 省电:小模型量化往往更费电,大模型才省;交叉点随 GPU 架构变化。
  2. 测量 / 估算分得清:柱状图与「已测模型」是实测;「你的模型」是估算,带置信区间,大模型只作方向参考。
  3. 知道每个数字的边界:GPU 芯片功耗、单流 batch 1、特定后端版本;RTX 4090 那一列每个配置 n = 1,没有误差棒可画。同一配置隔一次会话重跑,我们实测到的差异可达 8.2 个百分点(1.1B INT8:+146.1% 与 +137.9%)。
  4. 隐私:上传 energy.json 只在你浏览器本地解析,不上传服务器;分享链接把结果编码在 URL 里。