热点资讯

  • Home
  • 128GB DDR4内存在运行大模型时频繁损坏

128GB DDR4内存在运行大模型时频繁损坏

2026-10-02 2879

海外用户Future_Fuel_8425分享了在其工作站上运行大型模型的经历。这台配备了128GB DDR4 ECC内存的设备,仅在90分钟内就烧坏了一根内存条,几天后另一根也出现故障。用户使用的工作站是2019年款的ThinkStation P920,搭载双路至强处理器和RTX 5070 Ti显卡,内存为16根8GB DDR4条。之前,他一直在运行20B及以下的小模型,未曾出现问题。然而,当他切换到35B参数的Ornith-1.5模型时,发生了溢出,系统崩溃并留下ECC错误日志。初步拔掉故障内存后系统恢复正常,但经过一段时间的重度使用后,另一根内存条也显示即将失效。用户排除温度因素,CPU和GPU的温度保持在合理范围内,怀疑是内存老化和高负载连续读取造成的问题。虽然没有提供内存温度数据,但这也反映了消费级内存并不适合长时间高强度使用。

发表评论