Operation Cache(AMD US10606599B2)[2020]: OPERATION CACHE
AMD 专利(US10606599B2) [2020] 解读:Operation Cache 通过缓存 fixed-width decoded ops、物理索引/标记、way chaining 和共享 Imm/Disp 存储,降低 x86 前端取指解码延迟与功耗
Arm Neoverse 系列微架构参数
Arm Neoverse 系列微架构参数简介分析
AMD Zen 系列微架构参数
AMD Zen 系列微架构参数简介分析
SPEC CPU2026(2026 ISCA): SPEC CPU: The Next Generation
SPEC CPU2026 论文解读:按照论文行文思路梳理下一代 CPU benchmark suite 的定位、构建流程、可移植性工程、性能表征和 RRR 异构多程序方法。
IP-CaT(2026 ISCA): Enhancing Instruction Prefetching via Cache and TLB Management
2026 ISCA IP-CaT 论文解读:用面向 L1I prefetch 的 TLB translation buffer 与 L2C replacement policy 协同放大 instruction prefetching 收益
ICP(2026 ISCA): Exploiting Instruction Correlation for Prefetching Irregular Memory Accesses
2026 ISCA ICP 论文解读:用 instruction-level correlation 替代 address-level recurrence 来预取不规则访存。
XiangShan 数据预取器架构代码解读
XiangShan Prefetcher RTL 实现核心设计思想是: 上层预取器可以跨层级”指示”下层预取(L1 可以让 L2 预取,L1 可以让 L3 预取),但这种跨层指示走的是 专用旁路通道(sideband,BundleBridge),而不是 TileLink 缓存一致性总线上的 Hint 报文; 每个预取请求都携带”来源标识”(pfSource / MemReqSource),使得请求在跨层传递、在下层流水线处理、以及在性能统计时都能追溯到是哪一级、哪一个预取器发起的; 预取深度按层级递增:越靠近核心的层级(L1)预取得越”近”(lookahead 小),越远的层级(L2/L3)预取得越”远”(lookahead 大),以匹配各级 miss 延迟差异 各层级使用的预取器: 层级 算法 说明 L1 D-Cache Stride、Stream、SMS(Spatial Memory Streaming) Stride/Stream 由 L1Prefetcher 统一管理;SMS 是独立模块 L2(coupledL2) BOP...
XiangShan 跨 Cache Hierarchy 预取 (pf-ahead)
XiangShan pf-ahead 代码解读
(SiFive WO2023287512A1)[2023] Prefetcher with multi-cache level prefetches and feedback architecture
SiFive 专利(WO2023287512A1) [2023] 解读:用多级 MSHR feedback 决定同一 trained entry 应向 L1/L2/L3 发送多少预取
Data Prefetcher: Cross Cache Hierarchy
Cache 数据预取: 跨 Cache 层级的处理