Towards a Systems Foundation for Agentic Cloud Management
以智能体驱动的云管理正逐渐成为一种新兴实践,旨在自动化繁琐操作、减少人工干预(toil),并提升响应能力。尽管自主管理智能体技术发展迅速,但我们认为,当前最根本的缺失环节在于缺乏一个系统性基础架构,以支撑智能体之间以及智能体与人类运维人员之间安全、高效地协同作业。本文强调构建此类系统性基础架构的必要性,并介绍我们为开发“CloudWeaver”——一个兼容现有云平台用户界面、同时面向未来原生智能体接口的智能体驱动型云管理底层平台——所开展的工作。具体而言,我们阐述了CloudWeaver如何:(1)通过为每个智能体会话提供其专属的云资源局部视图,精准界定其操作上下文;(2)协调多个并发管理操作对共享云资源的访问与修改。CloudWeaver在存在意图冲突的情况下,仍能提供强有力的安全保障与可归因的反馈机制,同时确保相互独立的操作之间保持充分的并发执行能力。我们基于一个具有代表性的Azure API工作负载对CloudWeaver进行了验证。
How Do LLMs Read Bug Reports? An Empirical Study of Attention in LLMs for Automated Program Repair
基于大语言模型(LLM)的自动化程序修复(APR)系统正快速发展,但其修复性能仍不稳定。即使在提供完全相同上下文信息的情况下,同一个LLM也可能成功修复某一缺陷,却在另一个与之高度相似的缺陷上失败。造成这一现象的根本原因迄今尚不明确;我们尚不清楚LLM在处理缺陷报告时如何对其中纷繁多样的信息进行优先级排序,也不清楚模型的注意力机制是否会影响修复成败。本文首次针对LLM驱动的程序修复任务开展注意力模式实证研究,为模型如何解析缺陷报告、以及在修复过程中将注意力集中于哪些位置,提供了可解释的深入洞见。我们选取SWE-bench Verified与Multi-SWE-bench数据集中的319个真实世界Python和Java缺陷案例,系统考察以下三个研究问题:(RQ1)模型注意力在缺陷报告各组成部分(如缺陷描述、堆栈跟踪、测试用例等)间的分布规律;(RQ2)在每一类报告组成部分内部,成功修复与失败修复所对应的注意力模式存在何种差异;(RQ3)这些注意力模式与开发者实际认定的、对缺陷修复至关重要的信息之间具有怎样的对应关系。研究发现:成功的修复往往表现为注意力在多个诊断性信息组件(如缺陷描述、堆栈跟踪、测试用例等)上呈弥散式分布;而失败的修复则常表现出注意力过度局部化,即过度聚焦于版本号等元数据类信息。此外,我们还观察到:当模型的注意力分布与开发者标注的关键报告段落及关键短语越一致时,修复成功率越高。本研究首次以实证方式证实,注意力分配失当是导致LLM驱动的APR系统失效的关键因素之一;同时,也为设计更具可解释性与更高可靠性的下一代APR系统提供了切实可行的优化方向与实践启示。
OmniQEC: discovering practical quantum error-correcting codes by an AI scientist
量子纠错(QEC)是实现可扩展容错量子计算不可或缺的关键技术。然而,要发现仍具实际效能的QEC编码极具挑战性,因为逻辑性能取决于编码结构、硬件平台、伴随测量(syndrome extraction)方案与译码器之间的复杂耦合关系,而这些要素往往提出相互冲突的设计要求。本文提出OmniQEC——一种面向现代量子处理器部署、高效自主的AI科学家,专用于发现实用性强的QEC编码。OmniQEC将QEC编码设计建模为一个迭代式发现过程:由基于先进大语言模型(LLM)构建的“协调器”(orchestrator)统筹调度四大核心环节——编码生成、编码层级筛选、伴随测量电路综合,以及基于译码器的电路级性能评估。其核心机制融合了“自演化推理”与“快–慢协同工作流”:其中“快循环”利用低成本、高效率的编码层级代理指标(code-level proxies)快速探索候选编码;而“慢循环”则开展物理上更严谨的电路层级评估,并将所得实证结果反馈至搜索过程,持续优化迭代方向。我们在四类qLDPC编码构造族、三种不同LLM后端模型,以及每种后端分别配置14个物理量子比特的资源预算下,对OmniQEC进行了系统性评测。实验结果表明,所发现的编码在物理量子比特数增加时,逻辑错误抑制能力呈现稳定提升趋势;在总计98个和240个物理量子比特的完整实现预算下,其性能分别超越已知的BB编码(参数分别为[[72,12,6]]和[[144,12,12]])。此外,这些新发现的编码具备良好的硬件兼容性,本身即具有独立的应用价值,有望直接服务于实际QEC系统的工程实现。本研究为发展以物理建模为根基、融合编码–电路–译码器协同设计(code–circuit–decoder co-design)范式的、大语言模型赋能的QEC编码自动发现方法,铺平了道路。
Rethinking Training Data for Generating Code Review Comments
自动生成代码评审意见已成为自动化代码评审领域的重要研究方向,通常被建模为一种面向“代码差异—评审意见”(diff-comment)数据对的文本生成任务。尽管基于学习的方法已取得诸多进展,但所生成的评审意见仍普遍存在泛化性强、与代码变更关联薄弱或缺乏可操作性等问题。近期研究还表明,现有评审意见数据集本身包含大量噪声样本或不适宜用于训练的实例,因而催生了基于大语言模型(LLM)的数据集清洗方法。本文指出,这些存在问题的训练样本并非同质化,其中部分缺陷根源更在于任务建模方式本身存在深层次问题。通过对一个广泛使用的评审意见数据集开展实证分析,我们识别出一类“错配的训练样本”:即代码变更与其对应评审意见之间的关系无法为模型提供可靠的监督信号,使其难以从局部化的输入中生成具有实际指导意义的可操作评审反馈。我们据此构建了一个涵盖三类高频错配现象的分类体系,分别对应语义模糊性、缺乏可操作性以及上下文依赖性。进一步地,我们尝试将该分类体系融入基于大语言模型的过滤流程,以检验其是否有助于更精准地识别问题样本;实验结果表明,准确识别此类错配样本依然颇具挑战性。基于上述发现,我们认为,提升评审意见生成质量不能仅依赖于数据集清洗,还需引入明确的有效性判定标准、提供更丰富的上下文信息,并建立与评审意图及可操作性目标相一致的评估范式。
WarmTuner: Program-Specific Warm Starts for Compiler Autotuning via Offline-to-Online Reinforcement Learning
编译器是将高级程序翻译为机器码的基础性软件工具。现代编译器提供了数百种优化选项,每种优化均可通过一个优化标志(flag)单独启用或禁用,以提升生成代码的性能。然而,可能的标志组合数量呈指数级增长,使得为特定目标程序寻找一组合适的标志配置变得极为困难。现有的编译器自动调优技术主要通过剪枝搜索空间、引入搜索偏差或预测配置性能等方式来降低调优开销。尽管部分方法会利用程序特征,但其从历史数据中提取的知识在搜索启动后即被固化;此后,运行时反馈仅用于指导搜索过程本身,而无法更新这一先验知识。因此,当该先验知识与目标程序不匹配时,这些方法往往会在搜索收敛到优质配置之前,大量消耗本就有限的在线调优预算。 我们提出 WarmTuner——一种“离线到在线”的强化学习框架,其核心思想是将历史记录转化为一种以程序为条件的策略(policy),该策略能在全部标志空间上为每个标志预测最优取值,并且在目标程序上持续保持可适应性。在离线阶段,WarmTuner 基于历史中已知的优质配置,在整个标志空间上学习这一以程序为条件的策略;在在线阶段,它则利用目标程序的真实“编译–运行”反馈对该策略进行迭代精化,从而使策略的更新直接由实测加速比驱动,而非受限于历史数据。我们在在线更新环节采用“组相对策略优化”(Group Relative Policy Optimization, GRPO)算法:该算法在同一轮次内对候选配置进行两两比较,无需额外训练独立的值函数模型。我们在 GCC 15.2.0 上,使用 cBench 和 PolyBench 基准测试集对 WarmTuner 进行了评估。实验结果表明,WarmTuner 相比 GCC 的 -O3 编译选项平均取得 1.732 倍的性能加速,并在 30 个程序中的 14 个上取得了最佳性能,显著优于所有对比方法。
CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents
智能体运行框架(Agent harness)已成为现代大语言模型智能体的运行基础设施,通过协调上下文、工具调用、结果验证与执行控制,将模型潜在的能力转化为稳定可靠的长程任务行为。然而,实现可靠长程行为的关键在于运行框架需能动态适应具体任务需求、执行环境变化以及不断演进的执行状态;而当前主流运行框架大多依赖人工预设或全局固定的调度策略,这种僵化设计导致了不必要的计算开销,在极端情况下甚至会降低任务成功率。为克服这一局限,我们将运行框架中实现自适应编排的任务建模为一个因果学习问题,并提出面向长程任务智能体的“反事实运行框架干预学习”方法(CHILL-Harness)。CHILL-Harness 在编排层实施干预,支持以优势值为导向的工作流动态调整,从而在保障任务性能的前提下,提升推理效率与执行效率。具体而言,我们构建了“因果干预效应学习”作为 CHILL-Harness 的效应估计模块:该模块基于置信度加权的执行证据,估算不同干预方案相对于基准工作流所带来的优势增益,并据此识别出更具优势的工作流调整策略;进一步地,我们提出了“优势驱动的因果化编排”作为其实现模块:该模块能够自适应地分配反事实推理资源,仅对具备足够预期优势的工作流变更予以实际执行。最后,我们在 CHILL-Harness 中引入了“成功保持型目标函数”与“优势边际授权约束”,以确保所有自适应调整均以不损害任务成功率为核心前提,从而提升整体适应过程的可靠性。我们在涵盖信息检索、软件工程及终端交互等异构领域的多项长程任务上开展了大规模实验,结果表明:CHILL-Harness 在持续保持甚至提升任务成功率的同时,显著降低了令牌消耗量与执行耗时。
WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing
企业级智能体通常需要整合异构的知识源:文档用于承载叙述性事实,表格用于执行计算任务,而依赖关系图则用于刻画文件之间的关联。现有基准测试往往仅评估检索能力或工具调用能力,却未明确区分智能体是否首先准确选择了适配任务的知识源。为此,我们提出 WorkSurface-Bench——一个专门用于评估该能力(即“表层路由”能力)的新型基准测试。该基准包含 1,151 个原子级任务,全部源自面向特定角色设定(persona-scoped)的 Workspace-Bench-Lite 工作空间,涵盖文档、表格、图结构以及跨表层(cross-surface)四类问题。其参考答案具备可审计性:表格类答案通过实际执行 DuckDB 查询复现;文档类答案均锚定于经验证的文本片段;图结构类答案则可追溯至原始依赖关系标注。我们在六种受控的智能体配置下,对四种模型主干网络进行了系统评估,共生成 27,624 条无协议错误(protocol-error-free)的推理轨迹。在工具访问受限于黄金标准(gold-constrained)的前提下,各智能体的表层路由 F1 得分高达 98.7–99.8,但最终答案准确率(Answer)却仅为 56.1–75.3%,表明:正确选择知识源虽为任务完成的必要条件,却远非充分条件。进一步开展的匹配式干预实验显示:为三款模型提供表层提示(surface hints)可有效提升其最终答案准确率;而移除无关工具则主要改善表层路由性能与运行效率。在一项由三位独立标注员参与的审核中,所抽样的 200 个任务全部通过全部六项质量标准(按多数表决制判定),其中 192 个任务在每一项标准上均获得全体一致的评判结果。我们已将该数据集、构建流程、评分代码及智能体评测框架开源发布于 https://github.com/haolpku/WorkSurface-Bench。
Delta Debugging for Cyber-Physical Systems with Flaky Test Executions
基于仿真的测试被广泛应用于网络物理系统(CPS)的验证,然而现代CPS仿真器常常表现出非确定性(即“易变性”)行为,导致故障难以复现与调试。尽管差分调试(delta debugging)在确定性系统中已被证明行之有效,但其底层假设在随机性环境中并不成立。本文提出了三种差分调试算法,将统计性故障分析、多次重复执行以及环境感知的约简策略相结合,旨在为具有随机特性的CPS精准定位并隔离引发故障的最小化测试输入。我们在两个互补的案例系统上评估了所提出的技术:其一是采用随机优化算法的工业电梯调度系统;其二是因仿真器引入而非固有原因导致非确定性行为的自主移动机器人系统。实验结果表明,所提方法能显著缩短调试耗时,同时完整保留原始故障行为。更为重要的是,我们发现:对引发故障的测试输入进行最小化约简后,其故障复现率往往高于原始执行——通过剔除引入偶然性随机效应的执行片段,约简后的测试输入可更清晰地揭示故障的根本成因,并以更高概率稳定复现该故障。上述发现表明,差分调试不仅有助于简化故障分析过程,还能有效缓解执行过程中的易变性问题,从而为CPS的调试工作提供切实可行的方法学基础。
Demystifying Deep Learning Compiler Frontend Bugs: An LLM-Aided Empirical Study
深度学习编译器(DLC)旨在将深度学习程序转化为经过优化、适配特定硬件的代码。通常,DLC 的前端会将程序转换为基于图的中间表示(IR),以支持各类优化操作。这一阶段引入的缺陷(我们称之为“fBug”)影响严重,但迄今尚未得到充分研究——因为既有工作主要聚焦于底层 API 与算子,或将 DLC 整体视为黑盒式单一实体。 为填补这一研究空白,我们首次针对 TorchDynamo(当前最主流的深度学习框架 PyTorch 2 的默认 DLC 前端)开展了系统性实证研究,全面考察其中的 fBug。我们采用一种融合领域知识并由大语言模型(LLM)辅助的方法论,对 123 个 fBug 进行深入分析,并据此构建了一个涵盖 7 类根本原因及其下 15 个子类的分类体系。本研究所得结论为 DLC 的开发与测试提供了切实可行的指导性洞见。此外,我们进一步利用大语言模型生成具有针对性、且紧扣各类根本原因的测试用例,用于发现新的缺陷。借助该方法,我们在近期多个版本中成功发现了 23 个此前未知的 fBug(其中 15 个已获确认),覆盖全部八类(含子类)根本原因,充分验证了本方法在 DLC 前端测试与加固方面的有效性。
KQFuzz: Knowledge-Guided Fuzzing for Quantum Libraries via Large Language Models
随着量子计算技术的持续进步,保障量子程序库的可靠性与正确性正变得愈发关键。为此,研究者已提出多种基于大语言模型(LLM)的模糊测试方法,用以挖掘量子程序库中潜在的缺陷。然而,这些方法仍存在灵活性不足、效率偏低等局限性,制约了量子计算领域的进一步发展。为应对上述挑战,我们提出了KQFuzz——一种新型知识引导式量子程序库模糊测试工具。该工具充分利用全面的代码库知识,为基于大语言模型的测试用例生成提供坚实依据,并协同采用适应度引导的评估机制与两级变异策略,以深入探索复杂的程序执行路径,从而有效触发潜在缺陷。首先,KQFuzz设计了一种专为量子程序定制的创新提示(prompting)方案,通过有策略地融入代码库知识,高效生成高质量的量子初始测试程序(seed programs)。此外,我们还构建了专门面向所生成种子程序的评估与变异策略,在保障模糊测试高效执行的同时,进一步提升最终生成测试用例的多样性。我们实现了KQFuzz系统,并在三个主流量子程序库——Qiskit、PennyLane与Cirq上开展了模糊测试实验。实验结果表明,本方法在各项指标上显著优于当前最先进的同类技术,代码覆盖率最高提升达18.44%。在KQFuzz的研发过程中,我们共发现13个缺陷,所有缺陷均已被相关开发团队确认,其中12个已完成修复。