硬件指南 » 组件 » 处理器 » 计算 CPU 性能的所有公式和方法
核心关系:时间=(NI×CPI)/f,绩效=(f×CPI)/NI,其中CPI/CPI为关键杠杆。
真正的可扩展性:Amdahl 和 Gustafson 限制加速;效率随着开销的增加而降低。
内存规则:命中/未命中、DDR 和带宽对 CPI 的影响与频率一样大。
WPA 方法:关键路径、线程(就绪/运行/等待)、DPC/ISR 和优先级解释瓶颈。
当您寻找计算 CPU 性能的所有公式时,最好能通过上下文和实际案例对它们进行很好的解释。,而不仅仅是一个松散的方程式列表。 本指南以清晰全面的方式汇集并重写了专业分析的指标、公式、细微差别和技术。 (包括使用 Windows 性能分析器)这些通常分散在许多来源中。
在这里,您可以找到从经典单位(IPS、IPC、CPI 和 FLOPS)到执行时间和性能之间的精确关系、阿姆达尔定律和古斯塔夫森定律、内存和带宽的所有内容,甚至如何研究线程干扰和使用 WPA 的 DPC/ISR。此外,它还包括 CPU 功耗(C·V²·F)计算、测量工具以及实际效率和性能改进的建议。
基本单位和指标:IPS、IPC、CPI、FLOPS 和频率
首先要考虑的是我们要处理的最重要的单元是哪些:
IPS(每秒指令数) 测量处理器在一秒钟内执行多少条指令(通常为MIPS,百万IPS)。 这是一个有用的指标,可以了解吞吐量的总体情况,尽管它不能很好地捕捉指令复杂性或微架构差异。 历史和现代的例子表明设计与时代之间的差距,并且随着超频它可能会发生变化。
IPC(每周期指令数) 表示CPU平均每个时钟周期执行的指令数。 无论频率如何,了解每个周期的效率都是关键. 比较 IPC 需要使用相同的程序或基准 在不同的机器上,因为指令的数量和类型取决于软件。
CPI(每条指令的周期数) 它是 CPI 的概念逆转: 每条指令平均需要多少个周期. CPI 根据指令类型和微架构而变化。 (例如,加载可能需要比跳跃更多的循环),因此通常计算为 按教学类别加权平均值.
FLOPS(每秒浮点运算次数) 量化浮点计算,这对 HPC、AI 和科学至关重要。 单精度(SP)和双精度(DP)之间存在区别,并且能源效率也称为FLOPS/W。. 区分原生 FLOPS 和标准化 FLOPS 非常重要。 在比较异构平台时。
频率(Hz) 标志着时钟的节奏,但是 并不直接等同于绩效. MHz 的神话: 如今,低频 CPU 的性能可以超越高速 CPU 并行性、更好的 IPC 和更高效的微架构. 此外,流水线深度和关键逻辑决定了可实现的频率。.
英特尔酷睿 i9 14900K 与锐龙 9 7900X3D:两款最强 CPU 的性能对比基本公式:执行时间、吞吐量、IPC、CPI、IPS 和 FLOPS
一些 计算/衡量绩效的基本公式 您应该了解的处理器有:
执行时间处理时间:表达这一点的标准方式是 时间 = NI × CPI × T哪里 NI 是程序中的指令数, CPI 每条指令的平均周期数和 T 时钟周期(T = 1/频率)。 等价于:时间 = (NI × CPI) / 频率. 硬件和编译器经常攻击CPI和频率;NI依赖于软件。.
性能 是时间的倒数: 绩效 = 1 / 时间. 重写, 性能 = (频率 × CPI) / NI. 这明确了承诺三角:增加频率和 CPI 和/或降低 NI (更好的算法,更好的编译)提高了性能。
多处理器系统上的 CPU 时间 它通过添加线程时间或使用考虑的聚合来表达 P处理器. 并行地,实际可并行化的部分和协调开销限制了其好处。 (参见下文的阿姆达尔定律和古斯塔夫森定律)。
有效消费者物价指数 对于特定程序,它是从 观察到的每个周期的实际平均指令数 在执行过程中;为了进行比较, 使用相同的基准 在两台机器上,以便 NI 和指令混合具有可比性。
加权平均CPI 通常计算为 Σ(CPI_i × weight_i),每个 消费者物价指数 对应于一类教学,并且 权重 是该课程在课程中所占的比例。 这种基于类的视图允许您查看需要优化的地方(例如,缓慢的负载或昂贵的分割).
IPS(每秒指令数) 通常近似为 IPS ≈ 频率 × CPI. 小心管道、依赖关系、预测和通道清空:实际上, 爆发和惩罚可能会让你远离理论数字.
跳板 在一个简单的系统中,它估计为 频率×每个周期的浮动操作数 (取决于矢量宽度和 FPU 单元),并并行 总 FLOPS ≈ Σ 每个处理器的 FLOPS. 在 SP 或 DP 工作的区别 并记住 本机和标准化的 FLOPS.
IBM Power11的技术特性和性能可扩展性:阿姆达尔定律、古斯塔夫森定律、加速、效率和等效率
其他计算计算机性能、效率等的重要公式:
莱·德·阿姆达尔 对加速系统某部分所获得的收益进行建模。 如果一小部分时间 f 没有从改进中受益,则最大加速将受到 1/f 的限制. 在平行下,可并行化分数 p ,典型极限表示为 S(N) = 1 / ((1 − p) + p/N). 改善瓶颈(减少有效顺序部分)是最有价值的.
管道应用:流水线技术减少了稳定状态下每条指令的延迟,但 泡沫、数据风险和预测失败 他们增加了惩罚措施 限制理想的加速. 加深管道会增加频率,但也会加大排空的惩罚。.
古斯塔夫森定律 持不同观点:随着处理器数量的增加,问题也随之增加, S(N) ≈ N − α (N − 1),其中 α 通过缩放负载来近似计算序列分数。 他强调,负载分配和开销决定了真正的效率。.
效率 它被定义为 E = S(N) / N. 随着 N 的增加,E 趋于减小 通过协调、共享记忆和不平衡。 等效率 寻找如何 增加问题 n 的规模 为 随着 p(处理器)的增加,保持 E 不变,吸收开销。
内存、缓存、带宽和存储:另外 50% 的性能
除了处理计算之外,内存性能也很重要,其中最重要的公式是:
内存层次结构决定了 CPI:缓存访问可能需要 1 个周期,而 RAM 访问 数百次循环. 命中/失败率与原始带宽和延迟同样重要,甚至更重要。. 更好的命中率等于 更少的惩罚和更少的记忆力.
定义: 未命中率=失败次数/总访问次数 y 命中率=命中次数/总访问次数. 增加指令或数据缓存的大小并提高代码的局部性 提高命中率,降低CPI。
DDR和有效频率:DDR 内存性能 每周期 2 次传输 控制器,这就是为什么 DDR4-3200 相当于 1600 MHz 的 memclk. 理论带宽 按模块近似为 memclk × 2 × bus_width(位)× 通道数,以字节/秒(除以 8)表示。 DDR4-3200 的经典示例,64 位总线,双通道:1.600.000.000 × 2 × 64 × 2 = 409.600.000.000 比特/秒 ≈ 51,2 GB /秒.
HDD 中的旋转延迟 (当头部已经在轨道上时):估计为 0,5转/(RPM/60). 7200 RPM:0,5 / (7200/60) ≈ 4,16毫秒. 磁盘缓冲区和缓存可以缓冲一些访问时间,但它们并不能消除延迟的机械性质。
内存和计算需求:在 HPC 负载中,分析由 操作强度(FLOP/字节),有关 浮点指令和数据移动. 低强度 背叛 内存限制;很高的, 计算限制. 优化布局和顺序访问 可以彻底改变性能概况。
相关文章:最可靠的 CPU 和 GPU 基准测试
功耗和效率:TDP、动态功耗和工具
另一方面,我们还面临消耗和效率的问题:
TDP不是实际消耗:是热/设计目标。 功耗随有效负载、电压和频率而变化. 在轻负载下, 实际平均功耗通常远低于TDP.
近似动态功率:P = C · V² · F. C 是开关电容, V 电压和 F 频率。 增加电压会造成二次惩罚;因此超频与过压会导致 消耗和热量大幅增加. 除了动态部分外,还有随着温度和工艺过程而增大的泄漏。.
相关文章:英特尔酷睿 Ultra 9 185H 现身 CPU-Z,有望在笔记本电脑、迷你电脑和一体机上提供出色性能