软件运维中的一个问题
语言模型能否将软件故障的表现与其根因联系起来?OpenRCA 将这个问题置于软件运维场景中:模型需要利用遥测数据回答自然语言请求,而不能仅依赖提示词。
综合多种证据进行推理
该基准整合了 KPI 时间序列、依赖关系追踪数据与日志。其 RCA-agent 基线使用 Python 检索与分析数据,让模型能够处理大量遥测数据,而无需将每条记录都放入上下文。
了解这项研究
官方仓库提供了基准、基线与复现说明。相关论文发表于 ICLR 2025。
代表性研究
评估语言模型如何基于系统遥测数据进行推理,定位软件故障的根因。

语言模型能否将软件故障的表现与其根因联系起来?OpenRCA 将这个问题置于软件运维场景中:模型需要利用遥测数据回答自然语言请求,而不能仅依赖提示词。
该基准整合了 KPI 时间序列、依赖关系追踪数据与日志。其 RCA-agent 基线使用 Python 检索与分析数据,让模型能够处理大量遥测数据,而无需将每条记录都放入上下文。
官方仓库提供了基准、基线与复现说明。相关论文发表于 ICLR 2025。
Anthropic 使用作者提供的评测框架和基准官方评分方法,在 OpenRCA 上评估了 Claude Opus 4.6。
来源 · 2026-02-05· + 同等贡献
本页介绍依据所链接的公开来源。