← 返回首页

公开资料包 · 文献收集

AI Agent 驱动工程仿真方向的论文档案。按目录字母序逐条列出,每条为一篇论文的阅读档案原文,未做二次分类与加工。

38 ENTRIES · A–Z
01A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problemsabaqusagent

A Multi-AI-agent Framework Enabling End-to-end Finite Element Analysis for Solid Mechanics Problems

短名:AbaqusAgent

  • arXiv / 来源2606.00138
  • 作者 / 机构:Titu Ranjan Sarker、Muhammed Jawaad Zulqernine、Ling Yue、Shaowu Pan、Chenxi Wang、Shiyao Lin;机构在摘要页未列出。
  • 求解器:Abaqus(固体力学有限元)
  • 类型:agent 编排(基于 LLM 的多智能体框架)
  • 代码:https://github.com/LIRAM-LIN/AbaqusAgent

做什么

把自然语言指令转换为可执行的 Abaqus 有限元分析。目标是降低有限元分析的入门门槛,并减少因边界条件、载荷工况、求解变量定义错误导致的错误仿真。覆盖标准有限元分析的前处理和后处理全流程,最终给出结果可视化。

设计思路

把固体力学有限元分析拆成六个智能体串接的端到端流程,并用检索增强生成(RAG)从已整理的 Abaqus 案例库中取出最相似的输入文件作为模板。生成的输入文件不是从零写出,而是在模板上修改,保证语法正确并对齐物理类型。求解失败时由审查智能体迭代修正,直到跑通或达到迭代上限。新意在于把案例检索、领域硬过滤和加权打分结合,提升模板选取的准确率,从而提高仿真成功率并降低 token 消耗。

Agent 解决的问题

面向有限元分析的入门用户和教育场景。原来用户要做 Abaqus 分析需要多年工程经验,手工定义几何、材料、边界条件、载荷工况、求解步和网格,容易因关键组件定义错误导致仿真错误或静默的物理错误。基于应用编程接口(API)的自动化依赖预定义脚本和固定模板,更换几何或边界条件就要改写脚本,缺乏灵活性。该 agent 让用户用自然语言描述问题,自动完成前处理、求解和后处理,省去手工建模和脚本编写。

标准输入 / 输出

  • 输入:自然语言指令,描述一个固体力学问题。指令包含几何、材料属性、边界条件、载荷工况和需要输出的结果。解释智能体会检查这五类参数是否齐全,缺失时向用户索要。
  • 输出:可执行的 Abaqus 输入文件(.inp),由求解器运行后得到结果文件(.odb)。可视化智能体用 Python 脚本打开结果,自动保存变形数据和应力云图,导出 PNG 图像和 CSV 文件。

能力评价标准

按两者判定。论文用三个指标评估:

  • 检索准确率(retrieval accuracy):是否检索到最相似的参考案例。
  • 仿真成功率(simulation success):按规则判定,仿真能否跑通、求解是否成功完成。
  • 结果准确率(result accuracy):与 Abaqus 基准对照并经专家审查,部分案例与理论解对比,用于排除静默的物理错误。

所以成功既看规则上的求解能否完成,也看结果与基准或理论解是否一致。

方法

采用基于大语言模型的多智能体框架,由六个智能体串接,组成端到端流程:

  • interpreter(解释):解析自然语言指令,识别几何、材料属性、边界条件、载荷工况、结果输出五类参数;参数缺失时向用户索要,并改写提示词以提升后续质量。
  • architect(架构):把需求解析为案例名、领域、类别、材料四个字段,执行检索;先用 FAISS 在 104 个案例的 RAG 库中做语义检索,再按分析领域硬过滤,最后用加权打分(案例名 60%、类别 30%、材料 10%)选出最相似案例。
  • input writer(输入文件编写):以检索到的案例输入文件为模板,生成目标 Abaqus 输入文件,包含部件、材料、装配、求解步、边界条件、载荷、网格和作业设置。
  • runner(运行):执行输入文件,生成结果文件(.odb);成功转交可视化智能体,失败转交审查智能体。
  • reviewer(审查):分析错误文件,借助大模型推理和 Abaqus 专家系统提示生成修正,回传给输入文件编写智能体,迭代重写并重新求解,最多 15 轮,超出视为未解决。
  • visualizer(可视化):用 Python 脚本打开成功的分析,保存变形值和应力云图,导出 PNG 和 CSV。

RAG 库含 104 个固体力学问题,其中 71 个来自 Abaqus 基准手册,33 个为自编教材式问题。每个案例用三个维度存储:案例元数据、问题描述、输入文件内容;用 OpenAI 的 text-embedding-3-small 嵌入,存入单一 FAISS 向量库。底层大模型为 Claude Opus 4.6,温度设为 0.0。

结果 / 信号

  • 在 50 个评估案例上验证,含 40 个改编自 RAG 库的案例(改动了几何、材料、载荷或边界条件)和 10 个库外案例。
  • 整体仿真成功率 86%,结果准确率 86%(50 案例中 43 个成功)。
  • RAG 覆盖内的案例成功率 92.5%,库外案例 60%;40 个库内案例中 34 个检索到最相似案例,检索准确率 85%。
  • token 与耗时:库内成功案例平均 28761 token、157 秒;库外平均 48200 token、312 秒。RAG 命中显著降低 token 消耗和求解时间。
  • 消融研究(20 案例):同时开启审查智能体和 RAG 时,仿真成功率和结果准确率均为 90%;去掉 RAG 降到 80%,且 token 从 63 万升到 220 万;去掉审查智能体降到 45%。说明 RAG 提升准确率并降成本,审查智能体的迭代修正对结果准确率关键。
  • 底层模型影响:Opus 4.6 在仿真成功率(90%)和结果准确率(90%)上优于 GPT-5.2(65% 和 45%),后者在几何解释上更易出错。
  • 提示词质量影响:缺少网格指令会得到非结构化网格和错误几何;给出结构化径向网格指令则结果准确。
  • 局限:当前不支持多物理场和自定义网格的固体力学仿真,留作后续工作。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做电池 P2D 电化学建模,目标域为电化学;本文驱动 Abaqus 做固体力学有限元,目标域不同。共同点是采用多智能体编排,把自然语言转换为求解器可执行的仿真,并覆盖前处理与后处理全流程。本文的六智能体分工(解释、方案规划、输入编写、运行、审查、可视化)可作为 AutoSim 编排结构与审查环节的参考。差异在于固体力学的有限元配置与电化学 P2D 的物理接口、反应机理、参数识别需求不同,AutoSim 更强调机制判断和留出工况验证。

链接

  • 摘要页:https://arxiv.org/abs/2606.00138
  • 本地全文:paper.pdf
02AI CFD Scientist — 面向开放式 CFD 发现的物理感知 agentai-cfd-scientist

AI CFD Scientist — 面向开放式 CFD 发现的物理感知 agent(短名:ai-cfd-scientist)

arXiv/来源:arXiv:2605.06607,https://arxiv.org/abs/2605.06607 作者/机构:Nithin Somasekharan、Rabi Pathak、Manushri Dhanakoti、Tingwen Zhang、Ling Yue、Andy Zhu、Shaowu Pan(机构未在摘要页列出,代码库归属 RPI / csml-rpi) 求解器:OpenFOAM,经 Foam-Agent 驱动 类型:LLM 多 agent 自动科研系统,面向 CFD 闭合模型发现

做什么

把 LLM 驱动的科研循环接到高精度物理求解器上。系统在 OpenFOAM 上自动完成:基于文献的想法生成、参数与代码执行、物理验证、源码修改、配图与写作。

针对 CFD 提出三点约束。求解器跑完不等于物理结果正确。网格无关性和参考数据对齐是需要确认的研究对象,不能假定成立。湍流闭合模型要在 C++ 源码层修改,源码编辑属于假设空间的一部分。

设计思路

把 LLM 科研循环接到高精度物理求解器上,覆盖文献想法生成、验证执行、物理验证、源码修改和图文写作。核心是视觉语言模型(VLM)物理验证门:物理有效性不可从日志读出,需在图像层检查渲染流场。该工作提出五条设计原则:物理有效性需图像级检查、源码修改属于研究对象、网格无关性是必须的收敛门、agent 不得虚构实验或放松成功判据、文稿每条主张必须回溯到通过验证门的具体图或数值。在 OpenFOAM 上经 Foam-Agent 驱动,后端为 GPT-5.5。

Agent 解决的问题

求解器跑完不等于物理结果正确:算例可能干净收敛却用了错误几何、缺关键流动特征或产生退化输出,这些故障只在场图中可见,日志看不到。已有通用 AI-scientist 框架面向纯软件 ML,缺物理有效性门;已有 CFD agent 只做到案例配置、执行和部分后处理,不覆盖完整发现循环。该系统补上物理验证门和源码层假设修改,把求解器运行转成可辩护的科学结论。

标准输入 / 输出

输入为自然语言研究主题(必填),可选附带基准算例(base case)和参考数据(如 DNS)。例如"对 SA 湍流模型做修改并在周期山算例上验证"。 输出为完整的 OpenFOAM 算例与结果,含自动生成的案例配置、case-local 的 C++ 自定义模型库({case}/customModels/)、跨案例分析、渲染流场图,以及 LaTeX 文稿。中间产物为结构化交付物(study JSON、需求段落、源码修改计划、运行目录、图清单、解释 JSON)。

能力评价标准

两者兼有:规则判定加与 DNS/参考解的拟合误差。 规则判定层:Foam-Agent 执行案例并做低层错误修复;自定义库需本地编译通过并经冒烟测试产出可解释场;网格无关性门以基准与加密网格(约 10% 近壁、5% 体相加密)比较局部场与 U、p、C_f、C_p、升阻力/Δp 等量,5% 阈值标记需进一步网格收敛的量。VLM 物理验证门在 16 个植入故障中检出 14 个(87.5%),缺失交付物、量级错误、后处理损坏类全部检出,收敛充分性类只检出 2/4。 拟合误差层:T3 自定义粘度库在牛顿极限(n=1)与解析解误差在 0.5% 以内;T4 自定义 SA 修正在控制算例(APG=0)与内置 SA 四位小数内一致;T5 经 44 次自动迭代发现一个运行时源项修正,使周期山(Re_h=5600)下壁面 C_f 的 RMSE 相对 DNS 下降 7.89%(0.004297→0.003958)。 评估全部为人工,因当前无自动 CFD 论文评分标准。

方法

三条耦合路径。

  1. 常规实验(REG):文献检索 → 新颖性过滤 → 需求校验 → 网格无关性门控 → 执行。
  2. 代码修改:生成 C++ 源码 → 案例内本地编译 → 冒烟测试。
  3. 开放式发现(OED):生成假设 → 修改代码 → 执行 → 对参考数据比较。

核心组件是视觉语言模型(VLM)物理验证门。该门渲染流场图,用 VLM 检查是否出现预期物理特征,再决定是否接受结果、重跑或写入文稿。它针对的是能通过求解器自检、却使解释失效的故障。

结果/信号

仅记录论文给出的真实数字,全部采用 GPT-5.5 作为后端。

  • T1 后向台阶:在 Re_h=25,400 下跑四种 RANS 闭合,VLM 发现再附点提取器的符号约定错误,修复前不出排名。
  • T2 射流/羽流扫描:Re=60–600 共七个瞬态算例,恢复出预期的中心线速度标度,标记 case-006 中心线均值异常坍缩。
  • T3 自定义粘度模型:自动生成广义牛顿粘度库,牛顿极限(n=1)与解析解误差在 0.5% 以内。
  • T4 自定义 Spalart–Allmaras 修正:本地编译 APG 修正变体,控制算例(APG=0)与内置 SA 在四位小数内一致。
  • T5 开放式 SA 发现:经 44 次自动迭代,发现一个运行时源项修正,使周期山(periodic hill,Re_h=5600)下壁面 C_f 的 RMSE 相对 DNS 下降 7.89%(0.004297 → 0.003958)。
  • VLM 门消融:16 个植入故障中检出 14 个(87.5%)。缺失交付物、量级错误、后处理损坏类全部检出;收敛充分性类只检出 2/4。

与 AutoSim 的关系

机制相邻的 CFD 类比。该系统在 OpenFOAM 上做的事,与 AutoSim 在 COMSOL 上驱动锂电池 P2D 建模属于同一类问题:用 LLM agent 驱动高精度物理求解器,并对结果做物理层校验。

可借鉴点有三。一是物理验证门:求解器收敛不等于物理正确,需要在日志之外做图像层或状态变量层的检查,这与 AutoSim 的留出验证和拒绝输出思路一致。二是把验证门当作研究对象,网格无关性、参考数据对齐需要确认而非假定,对应到 P2D 即参数必须被训练数据约束并经留出工况验证。三是每轮只改一个建模假设再重新求解和验证的循环结构,与本系统的开放式发现路径相同。

差异点。本系统改的是湍流闭合模型的 C++ 源码,AutoSim 改的是 COMSOL 物理接口、反应机理与参数耦合。本系统仅用单一 LLM 后端,且定位为有人监督的科研助手,不做无人值守发表。

链接

  • arXiv:https://arxiv.org/abs/2605.06607
  • 代码:https://github.com/csml-rpi/cfd-scientist
  • 论文 PDF:paper.pdf
03ALL-FEM: Agentic Large Language Models Fine-tuned for Finite Element Methodsall-fem

ALL-FEM: Agentic Large Language Models Fine-tuned for Finite Element Methods(简称 ALL-FEM)

  • arXiv/来源:arXiv:2603.21011;项目页 https://fenics-llm.github.io 。亦发表于 Computer Methods in Applied Mechanics and Engineering, Volume 457, 2026。
  • 作者/机构:Rushikesh Deotale, Adithya Srinivasan, Mahmoud Golestanian, Yuan Tian, Tianyi Zhang, Pavlos Vlachos, Hector Gomez。
  • 求解器:FEniCS。
  • 类型:领域微调 LLM + 多智能体的有限元代码生成框架。

做什么

自动生成有限元分析代码,降低使用门槛。系统将自然语言问题表述为偏微分方程,生成并调试 FEniCS 代码,运行并根据运行时反馈迭代修正,最后可视化结果。覆盖固体力学、流体力学和多物理场三类问题。

设计思路

把领域微调与多智能体编排结合。先用合成数据流水线把 503 条专家整理的种子脚本扩成 1004 份经验证的 FEniCS 脚本(数据集为 Alpaca 格式的指令-输入-输出三元组,输出为可执行脚本),再用 LoRA/QLoRA 微调开源 LLM,把模型约束到合法的变分表述与 FEniCS 语法。核心新意是证明:较小的领域微调模型嵌入带运行时反馈的多智能体回路后,可超过更大的非智能体专有模型(微调 GPT-OSS 120B 双智能体回路优于非智能体的 GPT-5 Thinking)。智能体编排由 LLM 协调(非固定流程),Coordinator 按对话上下文选择下一个发言智能体,可在编码后回头让 Formulator 修正表述。

Agent 解决的问题

把自然语言问题自动转成可执行且正确的 FEniCS 代码。具体解决:将问题表述为 PDE 与变分弱形式(含边界条件);生成初始 FEniCS 实现;按 Executor 返回的运行时错误日志迭代调试直到可执行;检查表述与实现的一致性;可视化结果。双智能体框架由 FEniCS Coder 与 Executor 构成;多智能体框架含 Coordinator、Planner、Formulator、FEniCS Coder、Executor、Corrector、Evaluator、Admin 八个角色。

标准输入 / 输出

标准输入:自然语言问题描述,含几何、数学模型、材料、边界条件、网格与期望输出(指令加输入)。 中间输出:PDE 与变分弱形式表述、智能体间的规划与修正消息。 标准输出:可执行的 FEniCS Python 脚本(解出主未知量,如固体力学的位移、流体的速度),以及结果图与 XDMF 场文件。

能力评价标准

规则判定为主,相对误差为辅。主指标是代码级准确率 accuracy=正确解题数/总题数:先剔除全部不可执行代码,再把智能体解与专家准备的参考解画在同图上做视觉比对(判断是否在作图尺度上不可区分),最后用 LLM-judge 找差异并人工复核(如某解作图与参考一致,但代码用了平面应变而非要求的平面应力,判为错误)。最佳微调模型 GPT-OSS 120B 在双智能体框架代码级成功率 71.79%(同模型未微调 58.97%)。论文明确考虑过用对真值解的最大相对 L² 误差作判据,但因不同框架解在不同网格上、跨网格投影会引入误差而未将其作为主指标,仅在附录 A 对五个代表性问题做了 L² 误差对照与阈值敏感性的聚焦比较。基准为 39 题(16 固体、15 流体、8 多物理场;13 易/13 中/13 难,其中 5 题 PDE 完全不在训练集)。

方法

数据:构建 1004 份经验证的 FEniCS 脚本。种子集 503 条来自教程、讲义、DOLFIN 文档和内部脚本。合成部分用检索增强的多模型流水线:OpenAI o3 生成 7 类 PDE 问题,OpenAI o4-mini 为每个问题生成 10 个几何变体和 10 个边界条件变体,得到 700 份代码,用 Gemini 2.5 Pro 修正并由专家验证。

微调:对 Llama 3.2 3B、Qwen3 32B、Llama 3.3 70B、GPT-OSS 120B 用 LoRA/QLoRA 微调。GPT-5 Thinking 作为未微调基线。

智能体:双智能体框架由 FEniCS Coder 与 Executor 构成,生成代码并按错误日志迭代修正。多智能体框架含 8 个角色(Coordinator、Planner、Formulator、FEniCS Coder、Executor、Corrector、Evaluator、Admin),分担规划、表述、编码、执行、修正和评估。

结果/信号

  • 39 个基准:16 固体力学、15 流体力学、8 多物理场;难度 13 易、13 中、13 难。其中 5 个的 PDE 完全不在训练集中。
  • GPT-OSS 120B 微调,在双智能体框架下代码级成功率 71.79%(15 固体、11 流体、2 多物理场);同模型未微调为 58.97%。
  • 微调后的 GPT-OSS 120B 配合智能体回路,优于非智能体部署的 GPT-5 Thinking。
  • 其他模型双智能体结果:Llama 3.3 70B 微调 20.51%、Qwen3 32B 微调 12.82%、Llama 3.2 3B 0%。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做电池 P2D 电化学建模,ALL-FEM 驱动 FEniCS 做固体/流体/多物理场有限元建模。可在以下维度对照。

  • 领域微调 LLM:ALL-FEM 用 LoRA/QLoRA 在 FEniCS 脚本上微调开源模型,约束输出到合法的变分表述。AutoSim 关注 COMSOL 物理接口、反应机理和状态变量的正确表达,二者都需要把通用 LLM 约束到领域内可执行的求解器代码。
  • 求解器代码生成基准:ALL-FEM 给出 39 个分难度、分物理类别的基准,并报告代码级成功率。AutoSim 可借鉴这种基准构建和评测方式,建立 P2D 工况的留出验证集。
  • 智能体 vs 非智能体:ALL-FEM 表明带运行时反馈的多智能体回路,使较小的微调模型超过更大的非智能体专有模型。AutoSim 的研究循环也基于验证证据迭代修改建模假设,与此一致。

链接

  • arXiv:https://arxiv.org/abs/2603.21011
  • 项目页:https://fenics-llm.github.io
  • 本地全文:paper.pdf
04AutoNumerics:自主、PDE 无关的多智能体科学计算流水线autonumerics

AutoNumerics:自主、PDE 无关的多智能体科学计算流水线(AutoNumerics)

来源:arXiv 2602.17607,2026 年 2 月 19 日提交。

作者/机构:Jianda Du、Youran Sun、Haizhao Yang。摘要页未明确列出机构。

求解器:LLM 生成可执行的经典数值求解代码,涵盖有限差分、有限元、Fourier 谱方法、Chebyshev 谱方法等离散化方法。

类型:多智能体框架,从自然语言描述直接设计、实现、调试并验证 PDE 数值求解器。

做什么

针对一般 PDE,输入自然语言描述,自动产出经典数值求解器。求解器基于经典数值分析,代码透明可读,不使用神经网络黑箱。在 24 个 PDE 问题上评估,覆盖椭圆型、抛物型和双曲型,维度从 1D 到 5D。

设计思路

让 LLM 充当数值方案的设计者,直接生成经典数值求解代码,而不是输出神经网络或调用固定库 API。生成的代码基于经典数值分析,可读且可解释。

设计针对三个技术难点。第一,LLM 生成代码常含语法错误或逻辑错误,在高分辨率网格上调试既慢又浪费算力,采用由粗到细的执行策略,先在低分辨率网格上调试逻辑,通过后再升到高分辨率网格。第二,无解析解的 PDE 难以验证正确性,采用基于残差的自验证机制,计算 PDE 残差范数评估求解质量。第三,大规模时间推进会耗尽内存,采用历史抽稀机制,稀疏存储中间状态。

把稳定性与一致性的数值推理嵌入方案生成与选择环节,在执行前检测并剔除设计不当或非物理的求解配置。论文用一个设计不当的中心差分基线作为反例,该基线在 Advection 上的 nRMSE 高达 7.05e12。

Agent 解决的问题

把构建 PDE 数值求解器的专家工作自动化。传统流程需要数值分析专家手工选择离散化方法、设置时间推进格式并验证稳定性与收敛条件,门槛高且开发慢。

该 Agent 自动完成方案设计、代码实现、调试和验证。具体包括:将自然语言转为结构化问题描述;提出候选数值方案并按数值特征打分排序;剔除违反稳定性与一致性的方案;实现可执行求解器;在粗网格上修复逻辑错误,在高分辨率网格上处理数值稳定性问题;计算误差度量做自验证。失败时触发 Fresh Restart,丢弃当前代码并重新生成实现。

标准输入 / 输出

输入:自然语言 PDE 问题描述。

输出:可执行的经典数值求解器代码,并附带精度度量。代码涵盖有限差分、有限元、Fourier 谱方法、Chebyshev 谱方法等离散化方法。Formulator 先把自然语言转为含控制方程、边界与初始条件、物理参数的结构化描述,再由后续智能体生成求解代码。

能力评价标准

属于两者结合。

规则判定:求解器必须可执行并返回残差,系统对返回值做有效性检查(validity checks)。由粗到细执行中,粗网格阶段判定逻辑是否跑通,高分辨率阶段判定数值稳定性。重试上限为代码生成 2 次、粗网格 4 次、高分辨率 6 次,超限触发 Fresh Restart 重新生成。单次粗网格或高分辨率运行的墙钟时间上限 120 秒。

拟合误差:按可用参考信息选用三类相对误差,公式中正则项 ε = 1e-12。有解析解时用相对 L2 误差 e_{L2} = ‖u − u‖ / ‖u‖;无解析解时用相对 PDE 残差误差 e_res = ‖L(u) − f‖ / ‖f‖;守恒律等隐式解析关系用相对隐式残差误差 e_impl = ‖F(u)‖ / ‖F_ref‖。

论文报告的实际指标:与 CodePDE 基线在 5 问题集上对比,几何平均 nRMSE 为 AutoNumerics 9.00e-9、CodePDE 5.08e-3、FNO 9.52e-3。24 问题集中 19 个有解析解,其中 11 个达到相对 L2 误差 1e-6 或更好,Poisson 5.41e-16、Helmholtz 2D 3.50e-16。失败案例为 Biharmonic 6.14e-1 和 5D Helmholtz 9.8e-1。论文未明确给出判定通过与否的固定误差阈值,1e-6 是结果统计口径而非门控阈值。端到端运行时间多在 20-130 秒。

方法

流水线由多个分工智能体组成:

  • Formulator:将自然语言转为结构化问题描述。
  • Planner:提出 10 个候选数值方案。
  • Feature:提取数值特征用于打分。
  • Selector:对候选方案排序与过滤,剔除设计不当的方案。
  • Coder:实现可执行求解器。
  • Critic:在粗网格上调试逻辑错误。
  • Reasoning:生成理论分析。

采用由粗到细的执行策略。先在低分辨率网格上调试逻辑,通过后再提升到高分辨率网格,高分辨率上的失败按数值稳定性问题处理。重试上限:生成 2 次、粗网格 4 次、高分辨率 6 次,超限则重新生成实现。

验证使用三类误差度量:有解析解时用相对 L2 误差;无解析解时用 PDE 残差误差;守恒律问题用隐式残差误差。

结果/信号

与 CodePDE 基线(5 问题集)对比的几何平均 nRMSE:

  • AutoNumerics:9.00e-9
  • CodePDE:5.08e-3
  • Fourier Neural Operator(FNO):9.52e-3

24 问题集表现:

  • 19 个有解析解的问题中,11 个达到 L2 误差 1e-6 或更好。
  • Poisson:5.41e-16
  • Helmholtz 2D:3.50e-16
  • 端到端运行时间:20-130 秒。

失败案例:

  • Biharmonic:6.14e-1(四阶 PDE 局限)。
  • 5D Helmholtz:9.8e-1(高维局限)。

方案选择规律:周期边界用 Fourier 谱方法;Dirichlet 抛物型用有限差分/有限元配隐式时间步进;Dirichlet 椭圆型用 Chebyshev 谱方法。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模。AutoNumerics 是机制相邻的工作,二者都用多智能体把自然语言任务转为可执行的数值求解,并强调验证而非黑箱拟合。

差异在求解后端与领域:AutoNumerics 让 LLM 直接写经典 PDE 求解代码,目标是通用 PDE 的离散化方案选择;AutoSim 不自写离散化,而是调用 COMSOL 现有物理接口、反应机理和状态变量来表达目标现象,参数需被训练数据约束并经留出工况验证。

可借鉴点:由粗到细的执行与重试策略可降低高分辨率求解的失败成本;基于残差的自验证为无解析解工况提供了验证手段,与 AutoSim 强调的留出验证思路一致。其在四阶和高维问题上的失败也提示 LLM 生成求解器的适用范围边界。

链接

  • 摘要:https://arxiv.org/abs/2602.17607
  • HTML 全文:https://arxiv.org/html/2602.17607
  • 本地全文:paper.pdf
05Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimationbattery-sim-agent

Battery-Sim-Agent: Leveraging LLM-Agent for Inverse Battery Parameter Estimation

短名: Battery-Sim-Agent

  • arXiv / 来源: 2605.29560,提交于 2026-05-28,cs.AI
  • 作者 / 机构: Jiawei Chen(北京大学)、Xiaofan Gui、Shun Zheng、Weiqing Liu、Jiang Bian(Microsoft Research)、Shikai Fang(浙江大学)、Shengyu Tao(Chalmers University)
  • 求解器: PyBaMM 的 Doyle-Fuller-Newman(DFN)模型,即 P2D / Newman 电化学模型
  • 类型: agent 编排(LLM 智能体与仿真器闭环),并附带自建基准

做什么

把锂电池数字孪生的参数识别这一逆问题,从黑箱优化改写为推理任务。LLM 智能体与高保真电池仿真器闭环运行,读取仿真反馈,提出基于物理的参数更新假设,逐轮迭代收敛到目标参数。论文称这是首个将 LLM 智能体与高保真电池仿真器闭环耦合的框架。

设计思路

把参数识别这一逆问题从盲目的数值搜索改写为有物理依据的推理过程。传统黑箱优化把仿真器当作不透明的预言机,只用单一标量损失驱动搜索,样本效率低且易陷入不合理的局部最优。本文让 LLM 智能体读取分项的多模态反馈,对症状(残差与特征失配)做因果归因到具体参数(原因),从而把高维参数空间分解为有物理意义的子问题。智能体用持久记忆记录历史动作与结果,并先经试错预热建立参数敏感性规则。

Agent 解决的问题

电池数字孪生需要内部微观参数(电极孔隙率、固相与液相扩散系数、动力学反应速率等),这些参数通常无法直接测量,需要从可观测的宏观数据(端电压、电流、容量)反推。原来用贝叶斯优化或进化算法做黑箱搜索,把仿真器当预言机盲目试探,样本量大、易收敛到不合理解。该 agent 面向做电池参数识别的工程人员,用带物理推理的闭环替代盲搜,在更少迭代内得到更准、更可解释的参数,并省去大量物理实验。论文称相对黑箱优化的曲线匹配误差降低 67–95%。

标准输入 / 输出

整体输入:目标电池的观测轨迹 Y_obs(端电压、电流、循环容量)、参数边界 [ℓ, u]、迭代预算 T、预热步数 N_w。

每轮迭代的输入:结构化 JSON 的多模态反馈 F_t。包含整体误差(容量 MAPE、电压 RMSE)、特征空间残差(如恒流充电时间失配 cc_charge_time_mismatch_s、电压平台偏移 plateau_shift_v)、电压曲线叠加图路径,以及仿真事件(如 simulation_success)。

每轮迭代的输出:结构化 JSON 的参数更新。含 updated_params(待调整的物理参数及其乘性调整,如正极反应速率 ×1.2)与 rationale(物理依据说明)。投影算子 Π 把更新约束在物理边界内。

整体输出:一组识别出的电化学参数 θ*。

能力评价标准

按与真值的拟合误差判定,是拟合误差。合成基准上真值 θ* 已知(对文献基线参数做受控扰动构造),主指标是参数恢复的 MAPE 与轨迹 RMSE。首循环标定 Regular 模式:Ecker2015 MAPE 0.77% 对比 BO 27.37%,Marquis2019 1.27% 对比 13.54%,五种体系相对 BO 改进 58–97%。长时程退化拟合:OSS 版 Total MAPE 1.37%,O3 版 1.77%,BO 未收敛。真实数据用 CALCE 数据集 7 个任务,O3 版 Total MAPE 3.46%(真值未知,用轨迹误差作为代理)。论文还报告参数误差与轨迹误差在每个测试用例内单调同步下降(case 内 Pearson r=0.963,Spearman ρ=1.000,100% 用例单调同降),以此佐证轨迹拟合可作为参数恢复的有效代理。

方法

每轮迭代包含三步推理循环: 1. 分析反馈:智能体接收结构化 JSON,包含容量 MAPE、电压 RMSE 等残差、细粒度特征失配,以及电压曲线可视化。 2. 形成假设:依托持久记忆,用领域知识对偏差给出因果解释。 3. 提出更新:以结构化 JSON 返回带物理依据的参数调整。

关键设计: - 目标解耦。不把多目标聚合为单一标量,智能体在分项目标上做因果归因。 - 动态记忆 + 知识预热。记忆用专家知识初始化,先经试错预热阶段建立参数敏感性规则,再进入主优化循环。 - 两条流水线:短时程的首循环高保真标定,以及长时程的退化拟合。

结果 / 信号

  • 基准:5 种电化学体系(Chen2020、ORegan2022、Ecker2015、Prada2013、Marquis2019),Regular 与 Extreme 两种难度,0.2C / 1C / 2C 三种倍率,共 200 个测试任务。
  • 首循环标定(Regular 模式,对比贝叶斯优化):Ecker2015 上 MAPE 0.77% vs 27.37%;Marquis2019 上 1.27% vs 13.54%。论文称相对 BO 的 MAPE 改进约 58–97%。
  • Extreme 模式:在 Chen2020、ORegan2022、Ecker2015 上优势明显;Prada2013、Marquis2019 上 BO 仍有竞争力。
  • 长时程退化拟合:Battery-Sim-Agent-OSS 达 1.37% Total MAPE,Battery-Sim-Agent-O3 达 1.77%;BO 未能收敛。
  • 真实数据:CALCE 数据集 7 个任务,在含噪数据上可收敛。
  • 归因消融(Qwen2.5-32B 固定主干):移除逐轮记忆后 MAPE 从 3.33% 升至 32.94%,退化约 9.9 倍;记忆机制是主要增益来源。
  • 计算开销:匹配 20 步预算下,智能体 322.4s(仿真 58.1s + LLM API 248.9s),BO 541.0s。
  • 测试的 LLM:GPT-O3、GPT-OSS(120B)、Qwen2.5(7B/14B/32B)。

与 AutoSim 的关系

这是与 AutoSim 最直接对标的工作。两者都用 LLM 智能体驱动电化学仿真器完成参数识别,目标模型都是 P2D / Newman(此处经 PyBaMM DFN,AutoSim 经 COMSOL)。核心差异:本文以仿真扰动构造逆问题,留出真值已知,评测以参数 MAPE 为主;AutoSim 强调真实工况下的前向预测准确性、留出工况验证与适用范围,并在无法识别时给边界或拒绝输出。其记忆 + 分项反馈 + 单步假设更新的循环结构,与 AutoSim 的研究循环约定一致,可作为方法与基准设计的参照。

链接

  • 摘要页: https://arxiv.org/abs/2605.29560
  • 本地全文: paper.pdf
06CFDagent: A Language-Guided, Zero-Shot Multi-Agent System for Complex Flow Simulationcfdagent

CFDagent: A Language-Guided, Zero-Shot Multi-Agent System for Complex Flow Simulation(短名:CFDagent)

  • arXiv/来源: arXiv 2507.23693,提交于 2025-07-31。摘要页 https://arxiv.org/abs/2507.23693
  • 作者/机构: Zhaoyue Xu, Long Wang, Chunyu Wang, Yixin Chen, Qingyong Luo, Hua-Dong Yao, Shizhao Wang, Guowei He。机构为中国科学院力学研究所、查尔姆斯理工大学、中国科学院大学。
  • 求解器: 自研浸入边界法(immersed boundary method)求解器,笛卡尔网格上求解不可压流动,MPI 并行域分解。注:不使用 OpenFOAM(与预期主题中的描述不符)。
  • 类型: 多智能体系统,语言引导,零样本 CFD 仿真。

做什么

从自然语言指令出发,自主完成 CFD 仿真。用户用文本、图像或导入网格描述目标物体,系统生成几何、配置求解、运行并给出结果。目标是降低专家级 CFD 的使用门槛。

设计思路

核心是零样本、语言引导的多智能体框架,不依赖人工整理的案例库。系统由三个 LLM 驱动的智能体分工:预处理、求解、后处理,统一由 GPT-4o 经对话式系统提示协调。输入支持文本、图像和导入网格三种模态。预处理用 Point-E 文生三维扩散模型从文本或图像生成点云,经符号距离函数回归和 Marching Cubes 转为表面网格。求解采用自研浸入边界法,在笛卡尔网格上施加边界条件,无需贴体网格,因此任意复杂几何都可直接计算。

Agent 解决的问题

降低专家级 CFD 的操作门槛。标准 CFD 流程需要人工完成几何建模、网格划分、求解器参数配置和结果后处理,依赖专业知识。该系统把这三个阶段交给 LLM 智能体,用户只用自然语言描述物体和雷诺数,系统自主完成从几何生成到出图的端到端流程。论文强调对未见过的复杂几何也能零样本处理,不需要预置 CAD 模型或针对性训练。

标准输入 / 输出

输入是描述目标物体的自然语言提示、图像,或导入的预生成网格,并指定雷诺数。输出包含三部分。一是生成的三维几何:由点云经符号距离函数回归得到隐式表面,再用 Marching Cubes 提取为表面网格(论文称拉格朗日表面网格)。二是配置好的浸入边界法求解器在笛卡尔网格上的运行结果,求解参数(仿真终止时间、CFL 数、最大时间步、输出间隔)经对话式提示设定,默认欧拉网格在补充材料给出。三是后处理可视化与气动系数:时间序列曲线、二维云图、三维等值面(基于 Q 准则识别涡结构),以及无量纲阻力系数 Cd 和升力系数 Cl,定义为 Cd=D/(qS)、Cl=L/(qS),其中 q=½ρU²。

能力评价标准

评价标准是拟合误差,即把计算得到的阻力/升力系数与文献参考值对照。球体 Re=100:文本和图像生成几何 Cd=1.11,导入网格 Cd=1.12,文献值 Cd=1.10(Johnson 和 Patel)、1.08(Fadlun 等)。球体 Re=300:三种输入方式 Cd 均为 0.68,Cl 在 0.065 到 0.071 之间,文献值 Cd≈0.66、Cl 在 0.067 到 0.069 之间。相对误差小,约 1% 到 3%。论文以与文献值的定量对照判断准确性,未给出统一的通过/失败门控指标(如显式 MAPE 阈值)。对人体等复杂几何只报告 Cd≈1.3,无文献对照。

方法

系统由三个 LLM 驱动的智能体组成,协调使用 GPT-4o。

  • 预处理智能体:用 Point-E 文生三维扩散模型从文本或图像生成点云,经符号距离函数回归和 Marching Cubes 转为网格。
  • 求解智能体:通过对话式提示配置参数,调用浸入边界法求解器执行流动仿真,无需贴体网格。
  • 后处理智能体:分析结果并生成可视化。

框架用 Streamlit 实现。

结果/信号

  • 球体绕流 Re=100:文本/图像生成几何 Cd=1.11,导入网格 Cd=1.12,文献值 Cd=1.10。
  • 球体绕流 Re=300:Cd=0.68;升力系数 Cl 在 0.065 到 0.071 之间;文献值 Cd≈0.66,Cl≈0.068。
  • 复杂几何绕流(人、猫、狗、摩托车等)仅用自然语言描述完成,人体绕流 Cd≈1.3。

与 AutoSim 的关系

两者都是用 LLM 智能体驱动数值求解器,从用户意图自动配置并执行仿真。差异如下。

  • 物理域不同。CFDagent 求解不可压流动;AutoSim 求解锂电池 P2D 电化学模型,驱动 COMSOL。
  • 几何重心不同。CFDagent 把生成三维几何作为主要环节,用扩散模型从文本生成物体形状;AutoSim 的几何为一维或准二维电极结构,重心在反应机理、状态变量和参数耦合。
  • 验证方式可参考。CFDagent 用球体绕流的阻力/升力系数对照文献值做验证。AutoSim 强调参数必须被训练数据约束,并经留出工况验证;CFDagent 未涉及参数识别问题。
  • 可借鉴点:其三智能体分工(预处理/求解/后处理)和多种输入模态(文本、图像、网格)的处理方式,对 AutoSim 的任务分解有参考价值。

链接

  • 摘要页:https://arxiv.org/abs/2507.23693
  • HTML 全文:https://arxiv.org/html/2507.23693v1
  • 本地全文: paper.pdf
07ChatCFD:LLM 驱动的端到端 CFD 自动化智能体chatcfd

ChatCFD:LLM 驱动的端到端 CFD 自动化智能体(短名 ChatCFD)

arXiv/来源:arXiv 2506.02019,https://arxiv.org/abs/2506.02019

作者/机构:E Fan, Kang Hu, Zhuowen Wu, Jiangyang Ge, Jiawei Miao, Yuzhi Zhang, He Sun, Weizong Wang, Tianhan Zhang;机构信息 arXiv 摘要页未列出。

求解器:OpenFOAM。

类型:LLM 智能体驱动 CFD 求解器,端到端自动化。

做什么

ChatCFD 用大模型自动生成并运行 OpenFOAM 仿真案例。 输入为多模态用户描述、文档和网格。 输出为可执行的 OpenFOAM 案例文件,并附带物理解释。 目标是降低 CFD 配置门槛,复现文献中的算例。

设计思路

针对 CFD agent 三个未解决的难点:领域知识融入、多 agent 框架设计、大规模测试与演化。先把 OpenFOAM 手册和教程构建成结构化 JSON 知识库(文件依赖库、边界条件库、参数量纲库、求解器模板库)加向量库。再用结构化知识、精确错误定位(Error Locator)和迭代反思(Reflection)组合成四阶段流水线。核心新意是引入物理保真度(physical fidelity)指标,判断一个能跑通的仿真是否在科学上有意义。

Agent 解决的问题

CFD 实施门槛高、依赖专家经验和昂贵商业软件。已有 agent 多停留在教程级算例,难处理复杂几何、外部网格和未见工况。ChatCFD 用结构化知识和多模态输入把从论文到运行的端到端流程自动化,能处理外部网格和文献复现。

标准输入 / 输出

输入为多模态用户描述:自然语言对话、研究论文 PDF、网格文件(支持 Fluent .msh,用 fluentMeshToFoam 转换;OpenFOAM 网格需给 polyMesh 路径)。系统从论文中抽取多个算例供用户选择。 输出为完整可执行的 OpenFOAM 案例文件(system/fvSolution、system/controlDict、system/fvSchemes、0/ 场文件、constant/turbulenceProperties、constant/transportProperties 等),运行求解器,并由 Physics Interpreter 输出物理解释。

能力评价标准

两者兼有:规则判定加物理保真度判断。 规则判定:执行成功率(运行不崩溃完成)82.1%,对比 MetaOpenFOAM 6.2%、Foam-Agent 42.3%。 物理保真度(physical fidelity)按三层协议判定,是定性比对而非 RMSE:初始与边界条件匹配用户场景、物理属性与模型一致、后处理流场与真值流动特征对齐。整体物理保真度 68.12%,可运行算例内的物理保真度 87%。物理解释的 summary fidelity 为 97.4%,与整体 68.12% 的差距说明流畅叙述与可执行物理约束之间存在落差。 文献复现:NACA0012 不可压案例配置准确 40%、可运行 80%;Nozzle 可压案例配置准确 30%、可运行 60%。 灵活性:跨流态求解器选择 20/21 正确,湍流模型切换 100%。 成本:每案例 192.1k tokens、0.208 美元。

方法

底层模型为 DeepSeek-R1 和 DeepSeek-V3。 R1 用于复杂推理,如边界/初始条件抽取和错误分析。 V3 用于快速结构化操作,成本约为 R1 的一半。

工作流分五个阶段。 Stage 0 从 OpenFOAM 手册构建结构化 JSON 数据库。 Stage 1 处理多模态输入。 Stage 2 生成案例文件,经合成、抽取、校验三步。 Stage 3 进行错误修正。 Stage 4 由 Physics Interpreter 输出物理解释。

系统依赖多个知识库和模块。 求解器模板库、边界条件库、参数量纲库、文件依赖库提供结构化约束。 Error Locator 定位出错文件,是最关键组件。 ContextRetriever 分析文件间依赖,处理耦合物理。 Reflection 模块处理持续性错误。 系统通过 MCP 接入多智能体工作流。

结果/信号

基准测试 315 个案例。 执行成功率 82.1%,对比 MetaOpenFOAM 6.2%、Foam-Agent 42.3%。 物理保真度 68.12%。 每个案例消耗 192.1k tokens,成本 $0.208,约为 Foam-Agent token 量的一半。

消融实验。 移除求解器模板库后成功率降至约 48%。 移除 Error Locator 后成功率最低。

文献复现。 NACA0012 不可压案例:40% 配置准确、80% 可运行。 Nozzle 可压案例(rhoCentralFoam):30% 配置准确、60% 可运行。 湍流模型敏感性:Spalart-Allmaras 40%,RNG k-ε 10%。

灵活性。 跨流态求解器选择成功率 95.23%。 湍流模型切换成功率 100%(k-ε、k-ω SST、laminar)。

Physics Interpreter 的 summary fidelity 为 97.4%。 但整体物理保真度仍为 68.12%。 两者差距说明流畅叙述与强制可执行物理约束之间存在落差。

与 AutoSim 的关系

两者都用 LLM 智能体驱动数值求解器。 ChatCFD 驱动 OpenFOAM 做 CFD,AutoSim 驱动 COMSOL 做电池 P2D 建模。 ChatCFD 的物理保真度指标与 AutoSim 强调的预测准确性和留出验证思路相近。 两者都区分"能跑通"和"结果物理上是否成立"。 ChatCFD 的结构化数据库加错误定位,对 AutoSim 检查 COMSOL 物理接口和参数耦合有参考价值。 其文献复现的成功率(配置准确 30%-40%、可运行 60%-80%)说明此类任务仍有明显失败率。

链接

  • arXiv 摘要:https://arxiv.org/abs/2506.02019
  • 全文 HTML:https://arxiv.org/html/2506.02019
  • 论文 PDF:paper.pdf
08约束式 FEniCS 自然语言接口constrained-fenics-nl

约束式 FEniCS 自然语言接口 (constrained-fenics-nl)

A Constrained Natural-Language Interface for Variational Multi-Physics Finite Element Simulations in FEniCS

  • arXiv/来源: arXiv:2606.10928,提交于 2026-06-09,分类 cs.CE
  • 作者/机构: Nilay Upadhyay、Wesley F. Reinhart,均来自宾夕法尼亚州立大学(Penn State,工程科学与力学系 / 材料科学与工程系)
  • 求解器: FEniCS + Gmsh
  • 类型: 约束式自然语言接口,LLM 仅做前端解析与几何生成,求解核心由人写模板承担

做什么

让用户用自然语言描述有限元仿真任务,系统自动完成设置、网格、求解和后处理。核心做法是把 LLM 限制在前端任务,不让它写求解器代码。作者认为幻觉 FEniCS 代码是核心失效模式,因此直接把 LLM 从 FEniCS 代码路径中移除。

设计思路

核心设计是把 LLM 放在求解器之外,只做前端解析与几何生成。作者把抽象边界定为力学与可靠性问题,不只是软件设计问题。LLM 生成求解器代码会让幻觉的弱形式、错误边界条件或非法求解逻辑进入数值方法。系统因此让 LLM 仅完成两件事:把自然语言提示解析为字段封闭的结构化 JSON 规格;仅为目录之外的几何生成 Gmsh 代码。求解核心由确定性派发器路由到人写的 UFL 模板。新增一个物理类别需人工写一个模板并加一条派发表条目,LLM 无需学习新的弱形式。代价是适用范围受固定模板限制,收益是 FEniCS 求解的数学形式不由 LLM 产生。

Agent 解决的问题

Agent 解决有限元仿真设置的人工成本问题。工程师需把物理问题翻译为几何、本构律、边界条件、网格和求解器配置,每一步都可能在无明显报错的情况下产生错误结果。Agent 用自然语言接口降低这一人工成本,同时通过约束 LLM 角色与确定性求解,避免 LLM 生成求解器代码带来的可靠性问题。

标准输入 / 输出

输入是自然语言的工程描述,包含几何、材料、边界条件和载荷。输出链路如下:解析器把提示转为结构化 JSON 规格(含 problem_class、material、boundary_conditions、loads、analysis 等字段);校验器检查物理一致性;几何阶段对标准形状用确定性 Gmsh 生成器,对非目录几何用 LLM 生成 Gmsh 代码,输出 XDMF 网格与边界标记;确定性派发器按 problem_class 路由到五个人写 UFL/FEniCS 模板之一,组装出自包含的 FEniCS 脚本;脚本在子进程中执行,输出结果 JSON(标量指标)与 XDMF 场数据,再由后处理提取应力场、力-位移曲线等结果。

能力评价标准

评价标准是两者:既有规则判定,也有对解析解/已发表结果的拟合误差。确定性后端按相对百分比误差 |x_FEM − x_ref| / |x_ref| × 100% 与参考值比较(Table 3):线性悬臂梁 <0.1%,含孔板 <0.5%,Lamé 圆筒 <1%,三维悬臂梁 <0.2%,Cook's membrane 0.21%,橡胶块 <10⁻⁴%,弹塑性约 5%(主要由载荷步离散导致),热-力 <10⁻³%,相场断裂(二维与三维)约 2%。LLM 前端按规则判定的成功率评价:解析器基准(15 个提示)首轮有效解析率 60.0%,重试后最终 100.0%,问题类别准确率 100.0%,字段提取准确率 97.1%(Table 4);自定义几何基准(10 个案例)首轮成功率 90.0%,重试恢复 0.0%,最终 90.0%,唯一未恢复失败为 invalid_geometry(obround-slot)(Table 5)。几何成功的判定是代码通过语法检查、安全检查、几何校验、网格生成和边界标记校验。

方法

七阶段流水线。LLM 只承担两项任务:把提示解析为结构化 JSON 规格;仅为非目录几何生成 Gmsh 代码。这两步带错误反馈重试。

LLM 不写 FEniCS 模板,不推导弱形式,不写数值核心。变分形式由确定性派发器路由到五个人写的 UFL 模板:线性弹性、超弹性(Neo-Hookean)、弹塑性(J2 返回映射 + 线性各向同性硬化)、顺序热-力耦合、相场断裂(AT2)。

校验器检查物理一致性:材料常数为正、泊松比有效、刚体运动抑制。网格提供四档密度,可选局部加密。求解在子进程中执行,带确定性重试逻辑。

结果/信号

确定性后端十个基准全部与解析解或已发表结果定量一致:

  • 线性案例:误差 <0.1% 到 <1%
  • Cook's membrane 超弹性:误差 0.21%
  • 弹塑性:误差约 5%(主要由载荷步离散导致)
  • 相场断裂:误差约 2%

解析器基准(15 个提示):首轮有效解析率 60.0%(9/15),重试后最终 100.0%(15/15),问题类别准确率 100.0%,字段提取准确率 97.1%。

自定义几何基准(10 个案例):首轮成功率 90.0%(9/10),重试恢复 0.0%,最终成功率 90.0%,一个 obround-slot 案例因几何无效未恢复。

端到端演示:3D 钢制 L 形支架(带圆角和螺栓孔)弹塑性加载 40 步,从单条提示完成,耗时 87.5 秒。

对比:ALL-FEM 代码级成功率 71.79%;MCP-SIM 用多智能体纠正 FEniCS 代码。本系统以可扩展性换可靠性。

与 AutoSim 的关系

这是与 AutoSim 直接对位的架构参照。两者都驱动外部求解器(本文 FEniCS,AutoSim 是 COMSOL),都面临 LLM 生成求解器代码不可靠的问题。本文给出一条明确路线:LLM 只解析为结构化规格并派发到人写模板,求解核心确定化。

对 AutoSim 的启发:将物理接口、反应机理、状态变量的设定收敛为 LLM 解析的 JSON 规格,配合校验器检查物理一致性,再确定性派发到固定的 COMSOL 模板,可降低幻觉风险。本文的解析器重试机制(首轮 60% 到最终 100%)和几何生成边界(最终 90%,承认复杂工业几何超出纯自然语言工作流)也值得对照。其局限在于五个固定模板限制了适用范围,扩展新物理需人工写模板,与 AutoSim 追求的机制可扩展性存在张力。

链接

  • 摘要页: https://arxiv.org/abs/2606.10928
  • HTML 全文: https://arxiv.org/html/2606.10928
  • 本地全文: paper.pdf
09Engineering.ai: A Platform for Teams of AI Engineers in Computational Designengineering-ai

Engineering.ai: A Platform for Teams of AI Engineers in Computational Design(短名:Engineering.ai)

arXiv/来源: arXiv 2511.00122,分类 cs.AI。摘要页 https://arxiv.org/abs/2511.00122 ,全文 https://arxiv.org/html/2511.00122 。

作者/机构: Ran Xu(University of Stuttgart,航空航天工程与大地测量学院)、Yupeng Qi(University of Stuttgart,SimTech 卓越集群)、Jingsen Feng(University of Exeter)、Xu Chu(University of Exeter 与 University of Stuttgart)。

求解器: OpenFOAM(CFD)、CalculiX(结构有限元)、Gmsh(网格)、FreeCAD(几何)、BPM 模型(气动噪声,Python 实现)。

类型: 多智能体平台,覆盖参数化 CAD、网格、多学科仿真与自动优化。

做什么

该平台用一组 LLM 智能体完成计算设计任务。一个总工程师智能体协调四个专业智能体:气动、结构、声学、优化。每个智能体配备各自领域的知识。目标是把 CAD-CAE-优化全流程自动化。验证任务是无人机机翼优化。

设计思路

按人类工程团队的分工组织分层多智能体:总工程师(Chief Engineer)做需求分析、任务分解、数据流管理与学科耦合,下辖气动、结构、声学、优化四个专业智能体,每个配各自领域知识,框架由 Gemini 2.5 Pro 驱动。核心新意有三点:智能体间用文件中介通信,保证数据溯源与可复现;配记忆模块保存项目上下文、执行历史与检索增强的领域知识;架构可扩展,按标准化通信协议可加入热、制造等新学科智能体而不改核心。气动智能体集成 OpenFOAMGPT 2.0,声学智能体用 Brooks-Pope-Marcolini(BPM)模型从 CFD 结果提取边界层厚度等量。

Agent 解决的问题

把 CAD-CAE-优化多学科设计全流程自动化,近乎无人工干预。具体解决:协调跨学科耦合与并行执行(总工程师);自动配置湍流模型、边界条件与后处理(气动);从 CFD 结果做气动噪声分析(声学);执行 FreeCAD-Gmsh-CalculiX 的几何到有限元流程(结构);自动选优化策略含代理模型与贝叶斯优化(优化);遇错自纠正恢复。

标准输入 / 输出

标准输入:自然语言设计需求(如"设计一个轻量高效的无人机机翼")。 中间输出:结构化项目计划与任务分解、参数化 CAD、Gmsh 网格、各学科求解配置、智能体间文件中介的数据。 标准输出:多学科仿真结果(升力系数、升阻比、OASPL 声压级、应力场)与优化后的新设计配置(含代理模型预测与 Pareto 取舍)。

能力评价标准

规则判定为主,优化阶段辅以对留出测试集的拟合精度。流程可行性指标:超过 400 个参数化配置成功率 100%,零网格生成失败、零收敛问题、零人工干预。物理结果以合理性核对(如 NACA 4412 在 5° 攻角、25 m/s 最大升力系数 0.96;25 m/s 下四翼型 OASPL 均 135.8 dB),未与实验真值做相对误差比对。优化智能体用留出测试集报告代理模型拟合精度:高斯过程回归在测试集上应力 R²=0.86、重量 R²=1.00;据此发现应力降低 18.1% 的新设计(224 MPa、125.9 g)。论文未对物理参数做可识别性或留出工况验证,主要以工程流程自动化与成功率为信号。

方法

采用分层多智能体架构。总工程师智能体分解任务、管理数据流、处理学科间耦合。气动智能体集成 OpenFOAMGPT 2.0,自动配置湍流模型参数、边界条件和后处理。声学智能体用 Brooks-Pope-Marcolini(BPM)模型,从 CFD 结果中提取边界层厚度、位移厚度、动量厚度。结构智能体执行 FreeCAD-Gmsh-CalculiX 的 CAD 到有限元流程。优化智能体自动选择优化策略,包括代理模型和贝叶斯优化。智能体之间用文件中介通信,以保证数据溯源和可复现。系统配有记忆模块,保存项目上下文、执行历史和检索增强的领域知识。

结果/信号

气动分析:四种 NACA 翼型(0012、0015、2412、4412),雷诺数 2.91×10^5 至 4.08×10^5,共十二个算例。选定 NACA 4412:5° 攻角、25 m/s 时最大升力系数 0.96;4° 攻角、35 m/s 时升阻比 28.9。声学:25 m/s 下四种翼型 OASPL 均为 135.8 dB,OASPL 主要由速度决定。结构分析:432 个配置,成功率 100%,零网格生成失败、零收敛问题、零人工干预。优化:高斯过程回归在测试集上应力 R²=0.86、重量 R²=1.00;发现新设计应力降低 18.1%(224 MPa,125.9 g)。整体超过 400 个参数化配置,零网格生成失败。

与 AutoSim 的关系

该工作与 AutoSim 同属 LLM 智能体驱动仿真求解器的方向。它用文件中介通信和记忆模块支撑多智能体协作,可对照 AutoSim 的智能体编排设计。其优化智能体用代理模型加贝叶斯优化做参数寻优,并用留出测试集报告 R²,与 AutoSim 的参数识别和留出验证思路一致。差别在于求解器领域:该平台驱动 OpenFOAM/CalculiX 做气动-结构-声学多学科分析,AutoSim 驱动 COMSOL 做电池 P2D 电化学建模。其物理判断和参数可识别性方面着墨少,主要以工程流程自动化和成功率为信号。

链接

  • 摘要页: https://arxiv.org/abs/2511.00122
  • 全文: https://arxiv.org/html/2511.00122
  • 全文留存: paper.pdf
10多智能体 LLM 在有限元分析中的协作与可靠性fea-agent-collaboration

多智能体 LLM 在有限元分析中的协作与可靠性 — fea-agent-collaboration

arXiv/来源: arXiv 2408.13406(摘要页 https://arxiv.org/abs/2408.13406; PDF https://arxiv.org/pdf/2408.13406)。标题: Collaboration Dynamics and Reliability Challenges of Multi-Agent LLM Systems in Finite Element Analysis。

作者/机构: Chuan Tian, Yilei Zhang。新西兰坎特伯雷大学(University of Canterbury),工程学院机械工程系。

求解器: FEniCS(Python 有限元库),线弹性有限元。智能体编排用 AutoGen v0.7.5,底层模型 GPT-3.5-Turbo。

类型: 受控实验研究。比较智能体角色配置对 FEA 任务可靠性的影响。

做什么

研究多智能体 LLM 系统中角色组成和对话顺序如何影响推理质量与验证可靠性。任务是四个线弹性平面有限元题目,难度递增:任务 1 算位移场;任务 2 加右边界剪切;任务 3 在方板中央加圆孔再算剪切;任务 4 计算并绘制应力分量 σxy。任务取自 MechAgents(Ni & Buehler, 2024)。

设计思路

把多智能体协作当作受控变量来研究。固定四个线弹性有限元任务、固定 AutoGen 编排和 GPT-3.5-Turbo 底层模型、固定 12 轮对话上限,只改变智能体的角色组成和对话顺序。定义四类角色:Coder(写 Python 代码)、Executor(本地执行代码并回传结果)、Critic(评审代码并提建议)、Rebuttal(对 Critic 持不同观点)。再加一个冗余评审 Critic_Add(与 Critic 相同)。由这些角色组成七种配置(Combo 1 到 Combo 7),覆盖有无 Executor、冗余评审与对抗评审、2 到 4 个智能体。每种配置在四个任务上各重复 40 次,共 1120 次试验,用统计检验比较代码执行率、任务成功率、附和率和 token 消耗。核心是把功能互补和团队规模分离,并把评估拆成执行、规格/视觉、物理三级,从而暴露“代码能跑”和“物理正确”之间的鸿沟。

Agent 解决的问题

把自然语言描述的有限元任务自动转成可执行代码并求解,得到位移场或应力分量。同时研究多智能体协作能否提高这一过程的可靠性,即不同角色组成和对话顺序如何影响推理质量与验证可靠性。论文的结论是协作能在个别情况下处理几何和边界条件,但在物理正确性上仍不可靠。

标准输入 / 输出

输入是一个固定的线弹性有限元任务说明,用自然语言给出,包含几何、边界条件和要计算的量。例如任务 3 是在单位方板中央挖一个圆孔、右边界施加剪切,任务 4 是在该几何上计算并绘制应力分量 σxy。Coder 据此生成 Python/FEniCS 代码,Executor 在本地执行,输出是位移场或应力场的数值结果以及对应的 matplotlib 图像。参考真值是 Figure 1 给出的四张期望输出图。无 Executor 的配置在对话结束后对第 12 轮代码做事后执行再取输出。

能力评价标准

分三级,属两者(既有规则判定,也有正确性/验证判定),不是拟合误差。第一级是规则判定:代码能否成功执行(verification),按 pass/fail 统计代码执行率。例如含 Executor 的 Combo 2 和 Combo 6 在任务 1 达 97.5%、任务 2 达 100% 代码执行率。第二级是规格与视觉符合:执行产出的图是否与 Figure 1 参考图一致,按 pass/fail 统计任务成功率。执行成功不等于任务成功,例如 Combo 2 在任务 2 代码执行 100% 但任务成功率 0%。第三级是物理验证(validation,针对任务 3 和 4):人工检查生成代码中的本构方程和材料参数是否正确。关键发现是没有任何配置通过物理验证。即使几何与边界正确、视觉与参考图相似,生成的二维平面应力本构关系仍是与标准都不符的错误混合式,写成 Sigma(u) = 2Enu/(1-nu2)epsilon(u) + E/(1+nu)tr(epsilon(u))*Identity(2),而正确式应为 Sigma(u) = (E/(1-nu2))((1-nu)epsilon(u) + nutr(epsilon(u))Identity(2)),多轮 Critic/Rebuttal 评审均未发现。需要注意第三级物理验证是对本构关系正确性的定性判断,论文明确说明未与实验数据比较,不计算相对实测数据的数值误差阈值,因此不属于拟合误差类评价。

方法

定义四类角色:Coder(生成 Python 代码)、Executor(本地执行代码并回传结果)、Critic(FEniCS 专家,评审代码并提建议,不写代码)、Rebuttal(持与 Critic 不同观点,促成讨论)。额外加一个冗余评审 Critic_Add(与 Critic 相同),用于对比互补与冗余。共七种组合(Combo 1 到 Combo 7),覆盖有无 Executor、冗余评审与对抗评审、2 到 4 个智能体。

每个组合在四个任务上各跑 40 次独立重复,每次对话固定 12 轮且开局随机化轮次顺序,每个智能体至少参与 3 次交互。无 Executor 的组合在对话结束后对第 12 轮代码做事后执行。每次试验后清空对话记忆。总计 7×4×40 = 1120 次试验。所有智能体设 temperature=0, seed=42, max_tokens=2048。评估分三级:代码可执行(verification)、规格/视觉符合参考图、物理正确性(validation,针对任务 3 和 4 检查本构方程与材料参数)。统计用 Fisher 精确检验、卡方检验、单因素方差分析。

结果/信号

  • 三智能体组合 Coder + Executor + Critic(Combo 3)是唯一在任务 3 和 4 产生视觉正确解的配置(每个任务各 2 例),但这些例子未通过物理验证。
  • 含 Executor 组合代码执行率更高:Combo 2 与 Combo 6 在任务 1 达 97.5%、任务 2 达 100% 代码成功率。Executor 的作用在复杂任务上才显著(任务 3、4 p < 0.001;任务 1、2 不显著)。
  • 执行成功不等于任务成功。Combo 2 在任务 2 代码执行 100% 但任务成功率 0%。任务 3 中 Combo 2 有 35%(14/40)、任务 4 有 50%(20/40)运行产出空图或只画圆孔几何而漏掉板。
  • 系统性肯定偏差:任务 1 中 43 次 Rebuttal 干预里 39 次(90.7%)是附和,Combo 5 为 12/13(92.3%),Combo 7 为 27/30(90%)。即便 Critic 误判,Rebuttal 仍对 16 个错误诊断中的 14 个(87.5%)无异议附和。跨任务附和率 85%–92.3%。
  • 冗余降低表现:加入 Critic_Add 后,含 Executor 的 Combo 6 任务成功率仅 10%,低于 Combo 3 的 15%,且消耗更多 token。Combo 6 的 36 次失败全为边界条件错误,无执行失败。
  • 验证–确认鸿沟:任务 3 和 4 中没有任何组合通过物理验证。即使几何与边界正确,生成的二维平面应力本构关系仍是与标准都不符的错误混合式,多轮 Critic/Rebuttal 评审均未发现。
  • 任务 2 失败的 92.4% 是边界条件错误;任务 1 错误以代码错误为主(68.6%)且多可修复;任务 3、4 代码错误占比 79.8% 和 80.1% 且更难纠正。

与 AutoSim 的关系

该文研究的是 AutoGen 驱动 FEniCS 解线弹性有限元,与 AutoSim 用 LLM 智能体驱动 COMSOL 做锂电池 P2D 电化学建模属同一类“LLM 智能体驱动物理求解器”范式,结论可直接借鉴。其核心发现对 AutoSim 的预测准确性与验证设计有以下提示:

  • 代码可执行与结果正确是两件事。该文的“验证–确认鸿沟”对应 AutoSim 中“仿真能跑通”与“前向预测在留出工况上准确”的区别,提示不能用求解收敛代替对预测准确性的验证。
  • 物理正确性需要专门检查本构方程与材料参数。对应 AutoSim 中检查现有 COMSOL 物理接口、反应机理、状态变量和参数耦合是否足以表达目标现象,并要求参数被训练数据约束、经留出工况验证。
  • 角色互补优于堆数量,冗余评审会引发提前共识。对应 AutoSim 的研究循环每轮只改一个建模假设再重新求解和验证,避免多个同质评审快速达成错误一致。
  • 对抗角色易退化为附和。提示 AutoSim 在设计审查环节时应用证据触发的检查(如执行报错后再引入异议),而不能依赖名义上的对抗角色。

适用范围限制:该文只覆盖线弹性、四个固定任务、12 轮对话上限、同一底层模型,未与实验数据比较,结论不直接外推到非线性、接触或瞬态问题。

链接

  • 摘要页: https://arxiv.org/abs/2408.13406
  • PDF: https://arxiv.org/pdf/2408.13406
  • 本地全文: paper.pdf
  • 参考实现 MechAgents: Ni & Buehler (2024), Extreme Mechanics Letters 67, 102131
11FEA Assisted Agentfea-assisted-agent

FEA Assisted Agent

(开源项目,仅简介,未抓全文)

  • 仓库/来源:https://github.com/Farhad-Davaripour/FEA_Assisted_Agent
  • 求解器:Abaqus(有限元)
  • 类型:开源项目

简介

FEA Assisted Agent 通过 LlamaIndex 接 OpenAI 模型,自动化 Abaqus 有限元仿真。它生成参数化的 .inp 输入文件,调用 Abaqus 跑作业,从输出中提取 Von Mises 应力。基于 ReAct 的 agent 自动执行多组位移试验,做参数研究和敏感性分析。

与 AutoSim 的关系

与 AutoSim 同为 LLM-agent 驱动求解器。它生成 Abaqus 输入文件、运行作业、回读结果并做参数/敏感性扫描,对应 AutoSim 在 COMSOL 上的参数识别与扫描需求。其参数化输入生成和结果回读的自动化流程可作为参考。

链接

  • https://github.com/Farhad-Davaripour/FEA_Assisted_Agent
12FEABench: Evaluating Language Models on Multiphysics Reasoning Abilityfeabench

FEABench: Evaluating Language Models on Multiphysics Reasoning Ability — 短名 FEABench

  • arXiv / 来源: arXiv:2504.06260v1 [cs.AI], 2025-04-08(Preprint, under review)。摘要页 https://arxiv.org/abs/2504.06260
  • 作者 / 机构: Nayantara Mudur、Hao Cui、Subhashini Venugopalan、Paul Raccuglia、Michael P. Brenner、Peter Norgaard。Google Research;Harvard University。
  • 求解器: COMSOL Multiphysics®,经其 Java API 操作。
  • 类型: 基准(benchmark)+ agent 编排(多智能体多轮系统)。不含微调模型。

做什么

提出 FEABench 基准,评测 LLM 与 LLM 智能体读取自然语言问题描述、操作 COMSOL 有限元软件、生成 Java API 调用以建立模型并计算目标量的能力。基准含两个数据集:FEABench Gold(15 道人工核验、可定量核验的问题)与 FEABench Large(200 道算法解析自 COMSOL Application Gallery 教程的问题)。FEABench Gold 定义 ModelSpecs 与 Plan 两种任务版本。论文另设计一个可与 COMSOL API 及辅助工具交互、用执行反馈在多轮中改进解的智能体。

设计思路

把工程仿真转化为可定量核验的代码生成任务。从 COMSOL Application Gallery 教程构造问题,每题给出自然语言问题描述和唯一目标量真值。LLM 读取问题描述,生成一段 COMSOL Java API 调用,建立模型并导出目标量。在此基础上设计多智能体系统,用 COMSOL API 的逐行执行反馈在多轮中改进解。评测同时覆盖代码可执行性、模型结构对齐、物理推理正确性和目标量相对误差。

Agent 解决的问题

面向工程仿真人员,把"读懂问题描述、操作 COMSOL、写出正确 API 调用并算出目标量"这一过程自动化。原来需要人工在 COMSOL 图形界面中选择物理接口、建立几何、设定边界条件、求解并读数。FEABench 把这一过程交给 LLM 智能体,用执行反馈和工具检索代替人工试错。论文指出该任务对 LLM 的难点在低资源代码生成、空间维度推断、以及做出一致的物理推理决策(边界条件、材料属性)。

标准输入 / 输出

输入是一道有限元问题的自然语言描述,FEABench Gold 提供两种版本:ModelSpecs 版本输入为 Model Specifications(任务完整描述:几何、材料属性、物理与边界条件、需计算的输出)加 Selection Information(几何选择,点/边界/域,作为图像的替代);Plan 版本输入为 Plan(用 COMSOL 求解该问题的分步指令)。两种输入都被论文确认为自足、可独立求解。

输出是一段 COMSOL Multiphysics Java API 调用序列,与 Ground Truth Code 形式一致。在 COMSOL API 中执行后应导出一张表,其中的计算值应与 Target Value(目标物理量真值)匹配。

能力评价标准

两者结合:既按规则判定代码可执行性,也按与真值的拟合误差判定是否真正解出。具体指标(Table 1):

  • Executability(可执行性):解中可正确执行的 API 调用行数占比,纯规则判定。
  • Model Tree Score:与真值模型树的相似度,归一化到 0 到 1,衡量解路径与正确路径的结构对齐。
  • 物理指标:Interface Factuality(生成的物理接口是否为真实 COMSOL 接口、有无幻觉)、Interface/Feature/Feature Property Recall(与真值的召回)、Feature Dimension(特征空间维度是否匹配)。
  • Target Relative Error(目标相对误差):先由 LLM 判定导出值是否有效且非默认值,得 Valid Target 数;主指标 Relative Error | Strict 仅对 Valid Target 为真的问题计算平均相对误差,要求相对误差 < 10%。论文称 Relative Error | Strict 是判定问题是否真正解出的首要指标。

实际结果显示两类指标差距悬殊:最佳策略可执行性达 0.88,但 15 题中仅 1 题通过 Strict 阈,且该题导出值(20°C)实为 COMSOL 默认温度(正确值 18.3°C),疑似巧合而非真正解出。

方法

基线为非交互单轮生成,提示策略含 One-Shot 与 PhyDoc In-Context(提示中加入有效物理接口与特征列表)。多智能体系统由 ControllerAgent、CorrectorSubAgent、ToolLookupAgent 与 Evaluator 组成:先用 PhyDoc In-Context 生成 20 个样本,再对最优解修正 20 步。工具包括代码片段语义检索(RetrieveAnnotatedSnippets,检索 768 条 LLM 注释片段构成的库)、模型树属性查询、物理接口与特征查询。反馈为混合式:COMSOL API 返回每行执行结果(定义可执行行比例为 executability),当 executability 超过 90% 时调用 VerifierLLM 检查与问题描述的对齐与完整性。评测采用多面指标:Executability、Model Tree Score、物理指标(Interface Factuality、各级 Recall、Feature Dimension)、Target Relative Error(主指标 Relative Error | Strict 要求目标有效且相对误差 < 10%)。

结果 / 信号

  • 最佳策略生成可执行 API 调用的比例为 88%(ModelSpecs 多轮智能体 executability 0.88±0.03,相比 PhyDoc In-Context 的 0.62)。
  • 基线 ModelSpecs 单轮:Claude-3.5-Sonnet executability 0.79±0.03、Model Tree Score 0.69±0.07、Valid Target 1/15;GPT-4o 0.78±0.03、0.56±0.06、0/15;Gemini-1.5-Pro 0.60±0.05、0.46±0.07、0/15。开放权重 Gemma 系列更差(Gemma-2-9B-IT executability 0.44±0.06)。
  • Claude-3.5-Sonnet 在 FEABench Gold 与 FEABench Large 各指标一致最佳。
  • 用 API 信息接地显著降低接口幻觉:Interface Factuality 在 ModelSpecs 从 0.54 升到 1.0,在 Plan 从 0.38 升到 0.85。
  • 主指标 Relative Error | Strict 几乎无法满足:多轮智能体与 PhyDoc In-Context 实验中仅 1 个问题通过 Strict 阈,且该问题导出值 20°C 实为 COMSOL 默认温度(正确值 18.3°C),提示并非真正解出。
  • 提供显式 Plan 未一致提升表现,瓶颈在把决策翻译为正确语法的 API 调用,物理块 executability 最低。
  • 对照实验(附录 G):SWE-agent 在 Python 中可生成可执行代码,对 11 个问题算出有效目标,但仅 4 个通过 Strict 阈,瓶颈转为精度。

与 AutoSim 的关系

同属"LLM 智能体驱动 FEA 求解器"路线,但 FEABench 面向通用多物理且以 COMSOL 教程问题为基准,未涉及锂电池 P2D 电化学建模。其核心信号对 AutoSim 有参照价值:可执行代码生成已能做到较高比例(88%),但真正算对目标值(严格相对误差 < 10%)极难(15 题中仅 1 题,且疑似默认值巧合)。这印证 AutoSim 把验证重点放在前向预测准确性与留出工况验证、而非仅看代码可执行或单点匹配的取向。其物理块最难、接口易幻觉、需用 API 文档与执行反馈接地等发现,与"检查现有 COMSOL 物理接口、反应机理、状态变量是否足以表达目标现象"的机制判断思路一致。其混合反馈(API 执行信号 + VerifierLLM 对齐信号)与 AutoSim 的验证门控设计可对照。

链接

  • 摘要页: https://arxiv.org/abs/2504.06260
  • 开源仓库: https://github.com/google/feabench
  • 本地全文: paper.pdf
13FeaGPT: an End-to-End agentic-AI for Finite Element Analysisfeagpt

FeaGPT: an End-to-End agentic-AI for Finite Element Analysis(简称 FeaGPT)

  • arXiv/来源: arXiv 2510.21993,HTML 全文可用(https://arxiv.org/html/2510.21993)
  • 作者/机构: Yupeng Qi、Ran Xu、Xu Chu(通讯)。机构为 University of Stuttgart(SimTech 卓越集群、航空航天工程与大地测量学院)与 University of Exeter(环境、科学与经济学院)。
  • 求解器: CalculiX。几何用 FreeCAD,网格用 Gmsh。
  • 类型: 端到端有限元分析智能体,自然语言对话驱动。

做什么

把工程需求用自然语言输入,自动完成几何、网格、求解、分析全流程,输出经过校核的结构有限元结果。目标是结构 FEA 的全自动化,覆盖从几何生成到结果解释。

设计思路

按 FEA 实际工作流把流程组织成 GMSA(Geometry-Mesh-Simulation-Analysis)模块化流水线,自然语言输入贯穿全程。核心新意是用知识库做"语义拓扑映射":载荷与边界条件不用精确坐标指定,而用语义位置描述(如"左边缘""孔边界"),再由几何分析器映射到实际曲面块;材料按名称实时从知识库检索(如"Aluminum 7075-T6"自动取 E=71.7 GPa、ν=0.33、ρ=2810 kg/m³、σ_y=503 MPa)。生成几何时按相似度阈值 σ>0.85 复用标准件知识,其余合成新设计,兼顾可靠性与灵活性。单配置任务在求解后结束;参数化研究与优化任务继续进入数据分析阶段(回归、聚类、敏感性、代理模型、多目标优化)。

Agent 解决的问题

把自然语言工程需求自动转成经校核的结构有限元结果,无人工干预。具体解决:解析工程意图与隐含约束(如"航空应用"隐含材料选型与安全要求);用 FreeCAD 生成参数化 CAD;用 Gmsh 生成物理感知自适应网格;配置并运行 CalculiX;对批量参数化算例做统计分析以找最优配置。

标准输入 / 输出

标准输入:自然语言的结构、载荷、材料描述(含定量尺寸、范围设计空间、性能目标、分析类型)。 中间输出:结构化分析计划(材料规格、几何规格、边界条件、求解器配置)、FreeCAD 参数化 CAD 模型、Gmsh 网格。 标准输出:经校核的 CalculiX 有限元结果(应力场、位移等),以及参数化研究的统计分析结果(相关性、Pareto 前沿、安全系数、疲劳寿命判定)。

能力评价标准

规则判定为主,不与独立参考数据做拟合误差。求解可行性指标:432 个翼型算例求解收敛率 100%(432/432),零网格生成失败,平均迭代 15-20 次。结果以物理合理性核对,而非与实验真值比对:涡轮增压器算例给出最大 von Mises 应力(叶根 432 MPa)、叶尖变形(0.37 mm)等量并判断其物理是否合理;翼型算例用壳厚-应力相关系数 r=-0.77(p<10⁻⁸⁵)等统计量。论文未报告对独立参考数据的留出验证或相对误差阈值。

方法

采用 GMSA(Geometry-Mesh-Simulation-Analysis)五阶段流水线:

  1. 工程分析规划:解析意图,制定策略,编排流程。
  2. 几何生成:用 FreeCAD 生成参数化 CAD 模型。
  3. 智能网格:用 Gmsh 生成物理感知的自适应网格。
  4. 有限元求解:配置并运行 CalculiX。
  5. 结果分析:回归、聚类、敏感性分析、代理模型、多目标优化。

知识增强使用语义相似度阈值 σ>0.85,标准件复用,其余合成新设计。流程含闭环迭代。

结果/信号(仅记录实际检索到的数字)

工业涡轮增压器算例(110,000 rpm):

  • 7 叶片压气机(铝 C355):最大 von Mises 应力 432 MPa(叶根),最大叶尖变形 0.37 mm,配置生成 10–15 秒。
  • 12 叶片涡轮(镍基高温合金):最大 von Mises 应力 156 MPa,最大叶尖变形 0.46 mm,配置生成 10–15 秒。

432 个 NACA 翼型参数化算例:

  • 网格:单元数 119,627–140,578(四面体),均值 129,390,变异系数 4.6%,单例 34 秒,总计 72.8 分钟。
  • 应力:von Mises 最小 273.58 MPa,最大 1,108.97 MPa,均值 472.54 ± 135.76 MPa;安全系数 0.45–1.84;结构重量 77.28–188.22 g。
  • 求解:收敛率 100%(432/432),平均迭代 15–20 次,单例平均 63 秒。
  • 参数分析:壳厚与应力相关系数 r = −0.77(p < 10⁻⁸⁵);Pareto 前沿 11 个最优配置(占设计空间 2.5%);着陆工况 3.0g 对 88.4%(382/432)配置起决定作用;仅 9.3%(40/432)达到 160 MPa 疲劳极限下的无限寿命。
  • 总耗时:432 例约 7.2 小时(10 核并行),顺序等效约 23 小时,并行加速 3.2×。

与 AutoSim 的关系

AutoSim 用智能体驱动 COMSOL 做锂电池 P2D 电化学建模,FeaGPT 用智能体驱动 CalculiX 做结构有限元,两者在以下维度可对照:

  • 端到端流水线编排:FeaGPT 的 GMSA 把几何、网格、求解、分析串成单一自动流程,对应 AutoSim 把物理接口选择、参数识别、求解、验证串成研究循环。
  • 对话式控制:两者都用自然语言作为入口驱动外部求解器,降低使用门槛。
  • 对参考结果的验证:FeaGPT 用涡轮增压器和翼型算例核对结果的物理合理性,AutoSim 强调参数必须被训练数据约束并经留出工况验证。差别在于 FeaGPT 多以收敛性和物理合理性作为判据,未见对独立参考数据的留出验证;AutoSim 把留出验证作为前向预测准确性的核心判据。

链接

  • arXiv 摘要页:https://arxiv.org/abs/2510.21993
  • arXiv HTML 全文:https://arxiv.org/html/2510.21993
  • 本地全文:paper.pdf
14FEM-Bench:面向代码生成大模型的有限元结构化推理基准fem-bench

FEM-Bench:面向代码生成大模型的有限元结构化推理基准

来源:arXiv 2512.20732(2025 年 12 月)

作者/机构:Saeed Mohammadzadeh、Erfan Hamdi、Joel Shor、Emma Lejeune(原文摘要页未列出明确机构)

求解器:无外部求解器。任务为纯 Python(numpy/scipy)实现的有限元方法(FEM)与矩阵结构分析(MSA),不依赖商业仿真软件。

类型:评测基准(benchmark)

做什么

构建一个评测代码生成大模型的基准。目标是检验大模型能否生成科学有效的计算力学代码。任务覆盖有限元方法和矩阵结构分析,要求模型完成物理建模、数值离散和结构化推理。2025 版包含 33 个任务,对应研究生计算力学课程难度,题目入门但不平凡。基准强调诊断深度而非任务数量,用于分析大模型在科学计算中的失败模式。

设计思路

核心设计是用计算力学作为结构化科学推理的测试场。每个任务遵循固定的数学流程:控制方程写成弱形式,离散到有限维空间,组装为全局代数系统,再用客观数值检查验证。基准优先诊断深度,不追求任务数量。33 个任务设计成密集、多步、算法结构化,需要在单一解中整合多个相互依赖的计算环节。

任务用 CC/H/T 标注分层。CC 表示概念难度(CC0 线弹性与基础离散,CC1 弹性临界载荷分析)。H 表示参考实现用到的辅助函数数量。T 表示提供给模型的辅助函数层级(T0 不需要也不提供,T1 全部提供,T2 提供子集,T3 用到但不提供)。同一任务在不同 T 层级评测,用于区分领域知识缺失与组合推理缺陷。

基准探测四类能力:领域知识(回忆任务所需的力学与数值结构)、组合推理(将多个组件组装成正确的多步计算)、算法保真(以正确索引、一致符号约定和完整例程实现计算)、自验证(把任务正确性标准表达为可区分对错的物理感知单元测试)。

Agent 解决的问题

探测大模型能否生成科学有效的有限元方法和矩阵结构分析的计算力学 Python 代码。任务为纯 Python(numpy/scipy)实现,不依赖外部求解器或商业仿真软件。基准评测两类互补能力:生成数值正确的科学计算代码,以及生成能验证该代码的单元测试。代码必须符合规定签名、可执行、输出满足任务的数学与物理要求。测试必须用 pytest 编写,在参考实现上通过,在已知错误实现上失败。

标准输入 / 输出

这是一个评测基准。

输入是任务规格。每个任务是自包含的 Python 模块,含参考实现、辅助函数、pytest 风格测试、已知错误实现和 task_info() 元数据函数。元数据包含任务标识、函数签名、可用导入、辅助函数依赖、参考验证输入和测试用例。用 Jinja2 模板从元数据生成两类提示:代码生成提示和测试生成提示,严格约束输出格式、可用导入和可调用的辅助函数。提示中嵌入函数签名和详细 docstring,docstring 给出物理建模与数值离散要求。

输出是被评测的代码。代码生成任务输出符合签名的 Python 函数。测试生成任务输出名称以 test_ 开头的 pytest 测试函数。输出经 ast.parse() 验证语法,只提取第一个函数定义,使用未声明导入即判失败。

评分分两路。函数正确性:生成函数在参考验证输入上执行,结果与参考实现按数值容差递归比较,标量、数组、字典和嵌套结构逐层比对,任一层不匹配即判错;二值打分,全部输入通过得 1,否则得 0;运行时错误也判错。测试套件:三阶段评估,生成测试先在参考实现上执行须通过,再在所有预期失败实现上执行须失败,联合成功定义为既在参考实现通过又在所有预期失败实现失败;最终分数为达到联合成功的测试百分比。

能力评价标准

评价标准为两者结合:函数正确性用拟合误差判定,测试套件用规则判定。

函数正确性属拟合误差判定。生成函数输出与参考实现输出按可配置数值容差递归比较,而非简单字符串或执行检查。

测试套件属规则判定。判据是生成测试在 pytest 下的通过与失败行为,要求在参考实现上通过、在预期失败实现上失败。

论文实际指标(33 个任务):

  • 函数正确性,五次尝试:Gemini 3 Pro 表现最好,30 个任务至少五次中成功一次,26 个任务五次全部成功。
  • 函数正确性,单次运行:Gemini 3 Pro 29/33,Claude Opus 4.5 28/33,GPT-5 Mini 25/33,GPT-5 22/33,Qwen3 Coder 21/33,Claude Haiku 4.5 19/33,Qwen3 Next 16/33,Llama 4 Maverick 16/33,Llama 4 Scout 6/33。
  • 测试编写,平均联合成功率:GPT-5 最好 73.8%,Claude Opus 4.5 71.9%,Gemini 3 Pro 71.6%。
  • 无模型完成全部 33 个任务。T3 任务(用到但不提供辅助函数)持续弱于 T1 变体,反映领域知识缺失。

方法

任务分三个领域:一维 FEM(离散、单元组装、一维线弹性)、二维 FEM(高阶插值、多维数值积分、几何映射、三角形和四边形网格)、三维 MSA(局部刚度矩阵、全局组装、特征值分析、弹性临界载荷)。

每个任务是自包含的 Python 模块,含参考实现、pytest 风格测试、依赖函数、已知错误实现(用于预期失败测试)和 task_info() 元数据函数。

用 Jinja2 模板从元数据生成两类提示:代码生成提示和测试生成提示,严格约束输出格式、导入和可用辅助函数。

模型经统一 API 调用(OpenAI、Gemini、Claude、Together AI 上的开源模型),温度 0.1,支持推理的模型设为 high。每个任务独立调用,无跨任务记忆。

评测分两路。函数正确性:生成函数在验证输入上执行,结果与参考实现按数值容差递归比较,二值打分。测试套件:三阶段评估,要求生成的测试在参考实现上通过、在所有预期失败实现上失败,并计算联合成功率。

难度用 CC/H/T 标注,T3 表示参考实现需要辅助函数但不提供,用于区分领域知识缺失与组合推理缺陷。

结果/信号

  • Gemini 3 Pro 在函数编写上表现最好:33 个任务中 30 个至少在五次尝试中成功一次,26 个五次全部成功。
  • GPT-5 在单元测试编写上表现最好,平均联合成功率 73.8%。
  • 不同模型间表现差异显著。
  • T3 任务(无辅助函数)持续弱于 T1 变体,反映领域知识缺失。需要多概念综合的任务成功率明显下降。
  • 作者结论:尽管任务相对简单,当前最先进模型仍有显著改进空间,与物理类科学计算的要求存在明显差距。

与 AutoSim 的关系

AutoSim 驱动 COMSOL,完成锂电池 P2D 电化学建模。FEM-Bench 与之机制相邻但不同。

相邻点:两者都评估大模型能否生成科学有效的数值代码,都强调客观验证(参考实现比对、单元测试),都关注组合推理和数值保真(刚度矩阵组装、符号约定、数值边界处理)对应 P2D 中的物理接口耦合与离散。FEM-Bench 提出的四类能力(领域知识、组合推理、算法保真、自验证)和分层诊断思路,可借鉴用于评估 AutoSim 在建模假设和参数识别上的失败归因。

差异点:FEM-Bench 求解纯 Python 实现的力学问题,不涉及外部求解器、参数识别、留出工况验证或对真实实验数据的前向预测;任务规模和物理复杂度低于 P2D 全模型。其自验证测试评估方法可作为 AutoSim 验证环节(用物理约束构造测试,检验是否过松或过严)的参考。

链接

  • 摘要:https://arxiv.org/abs/2512.20732
  • 全文:https://arxiv.org/html/2512.20732
  • 本地全文:paper.pdf
15Foam-Agent:自动化智能 CFD 工作流foam-agent

Foam-Agent:自动化智能 CFD 工作流 · 短名 Foam-Agent

arXiv/来源:arXiv 2505.04997 · https://arxiv.org/abs/2505.04997

作者/机构:Ling Yue、Nithin Somasekharan、Tingwen Zhang、Yadi Cao、Zhangze Chen、Shimin Di、Shaowu Pan。机构包括 Rensselaer Polytechnic Institute、UC San Diego、Zhejiang Normal University、Southeast University。

求解器:OpenFOAM(CFD,计算流体力学)。

类型:多 agent 框架,基于大语言模型,自动化端到端 CFD 工作流(初版)。

做什么

从自然语言提示出发,自动完成 OpenFOAM 仿真的全流程。流程覆盖仿真计划、网格生成、配置文件编写、本地或 HPC 求解、纠错、后处理可视化。目标是降低 CFD 仿真的专家门槛,使非专家也能完成端到端仿真。

设计思路

核心是用六个 agent 把 OpenFOAM 端到端流程拆分并串联,从单条自然语言提示生成可运行的仿真。检索环节用分层多索引 FAISS,把领域知识按案例结构、配置细节、执行脚本、命令文档四个维度分别建索引,按工作流阶段选择对应索引,提升检索精度。配置文件生成用依赖感知方式,把文件生成建模为依赖图的拓扑遍历,按依赖顺序生成并把前置文件内容注入上下文,抑制未定义变量的幻觉。Reviewer agent 读执行日志做迭代自纠错,求最小配置补丁消除错误,并维护历史记录避免循环。整体能力经 Model Context Protocol(MCP)暴露为原子可调用函数,由 LangGraph 编排,可被更上层 agent 组合调用。

Agent 解决的问题

CFD 工作流分散且学习曲线陡,需要多年领域经验。已有 LLM agent 框架(如 MetaOpenFOAM、OpenFOAMGPT)覆盖不全,多聚焦求解器配置,忽略网格生成等预处理与可视化等后处理;多为单体设计,难以集成进更广的探索式研究流程;在复杂任务上执行成功率不高。Foam-Agent 针对这三点:覆盖从网格生成到后处理的完整生命周期;用依赖感知生成加分层检索施加物理约束、减少幻觉;用 MCP 模块化解耦,便于组合。

标准输入 / 输出

输入是单条自然语言 CFD 提示,描述问题、物理场景、几何、求解器要求、边界条件、仿真参数。输出是一套完整的 OpenFOAM 案例文件,按 system / constant / 0 三个目录组织(数值控制与离散格式、物理与湍流属性、初始与边界条件),外加 Allrun 脚本及 HPC 上的 Slurm 提交脚本,并执行求解,最后用 PyVista 或 ParaView 后处理生成可视化(如 png 速度云图)。

能力评价标准

采用规则判定,以执行成功率衡量,即案例能否成功跑通求解。CFDLLMBench 含 110 个 OpenFOAM 仿真任务、11 个物理场景。Foam-Agent + Claude 3.5 Sonnet 执行成功率 88.2%,MetaOpenFOAM + Claude 3.5 Sonnet 为 55.5%;Foam-Agent + GPT-4o 为 59.1%,MetaOpenFOAM + GPT-4o 为 17.3%。消融实验:Reviewer node 把成功率从约 50% 提升到 >80%;无 reviewer 时分层检索使成功率从单索引 44.6% 升到 57.3%,含 reviewer 时分层 88.2% 对单索引 84.6%。成功判据是执行成功(跑通求解),不是与真值数据比对物理准确性。论文对三个代表案例(CounterFlowFlame、wedge、forwardStep)做了与真值的可视化对比,但这是定性图示,未纳入打分。该框架不闭合物理正确性或留出验证回路;论文把执行级正确到结果级对齐列为未来工作。

方法

系统由六个 agent 组成:Architect 把自然语言翻译为带依赖的结构化计划;Meshing 提供 OpenFOAM 原生、Gmsh、外部网格三种网格生成方式;Input Writer 按 system → constant → 0 的依赖顺序生成配置文件并保持参数一致;Runner 在本地或 HPC 集群求解,生成 Slurm 脚本并记录日志;Reviewer 读日志做迭代纠错,提出最小补丁并跟踪历史避免循环;Visualization 用 PyVista 或 ParaView 后处理。

检索环节用分层多索引检索:四个 FAISS 索引分别覆盖案例结构、配置细节、执行脚本、命令文档。配置文件生成采用依赖感知的拓扑排序。CFD 能力经 Model Context Protocol(MCP)暴露为原子函数。

结果/信号

  • 在 CFDLLMBench 上含 110 个任务、11 个物理场景。
  • Foam-Agent + Claude 3.5 Sonnet:执行成功率 88.2%。
  • MetaOpenFOAM + Claude 3.5 Sonnet:55.5%。
  • Foam-Agent + GPT-4o:59.1%;MetaOpenFOAM + GPT-4o:17.3%。
  • 消融:Reviewer agent 把成功率从约 50% 提升到 >80%;分层检索使无 reviewer 成功率从单索引 44.6% 升到 57.3%;含 reviewer 时分层 88.2% 对单索引 84.6%。
  • 文件依赖主要降低 API 调用与运行时间,对成功率影响小。

与 AutoSim 的关系

两者都用 LLM 多 agent 驱动数值求解器并自动化建模流程。Foam-Agent 驱动 OpenFOAM 做 CFD,AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模。可借鉴之处:按依赖顺序生成配置文件、读求解器日志做迭代纠错、用专用检索索引提供领域知识、把求解能力解耦为可调用函数。

差异在验证目标。Foam-Agent 聚焦执行级正确性,即能否成功跑通求解,未对结果做物理正确性闭环验证。AutoSim 需要前向预测准确性与留出工况验证,要求参数被训练数据约束并经独立工况检验,对无法识别的参数给边界或拒绝输出。这一验证层是 Foam-Agent 当前缺失、AutoSim 必须补足的部分。

链接

  • arXiv 摘要:https://arxiv.org/abs/2505.04997
  • 全文 HTML:https://arxiv.org/html/2505.04997
  • 本地全文: paper.pdf
16Foam-Agent 2.0:端到端可组合多 agent CFD 框架foam-agent-2

Foam-Agent 2.0:端到端可组合多 agent CFD 框架(短名:Foam-Agent 2.0)

arXiv/来源:arXiv:2509.18178(https://arxiv.org/abs/2509.18178)

作者/机构:Ling Yue、Nithin Somasekharan、Tingwen Zhang、Yadi Cao、Shaowu Pan。机构在摘要页未明确列出。

求解器:OpenFOAM(CFD)。

类型:多 agent 框架,自然语言驱动的端到端仿真自动化。

做什么

从单条自然语言指令自动完成完整 OpenFOAM 工作流。覆盖预处理、网格生成、配置文件编写、求解执行、错误修复、后处理可视化。目标是降低 CFD 的使用门槛与手工配置成本。

设计思路

针对已有系统的三处空白做改进:一是覆盖完整端到端流水线,含外部网格处理、Gmsh 生成新几何、HPC 提交脚本、ParaView 后处理;二是用 Model Context Protocol 把核心功能拆成离散可调用工具,从单体 agent 变为可组合服务,便于被其他 agentic 系统编排;三是用分层多索引 RAG 加依赖感知生成提高配置准确性。六个 agent 按自适应拓扑协作,用 LangGraph 管理有状态流程,用 Pydantic schema 约束输入输出。

Agent 解决的问题

CFD 是专业门槛高、手工配置繁重的流程,需要定义几何、生成网格、设边界与初始条件、选湍流和物理模型、配求解参数。小错误如缺字段或量纲不一致就会让求解器崩溃。Foam-Agent 把这一整套流程自动化,降低专业门槛,并能扩展到大规模 HPC 工况。

标准输入 / 输出

输入为单条自然语言指令,描述流动问题、几何、边界条件、运行参数。例如二维不可压顶盖驱动方腔,顶壁 x 方向 1 m/s,运动粘度 1e-5 m²/s,时间 0 到 10、步长 0.005、每 100 步输出。用户可选附带外部网格文件(.msh 或 blockMeshDict/snappyHexMeshDict)。 输出为完整可运行的 OpenFOAM 算例:system/(控制与数值格式)、constant/(物理属性、湍流属性、polyMesh)、0/(初始与边界条件)及 Allrun/Slurm 脚本;执行求解;可选用 ParaView/PyVista 出图。

能力评价标准

主要为规则判定,不与真值或 DNS 比较拟合误差。 成功判据为仿真运行到完成(Runner 返回 SUCCESS),按成功率统计。110 个算例、11 个物理类别:Claude 3.5 Sonnet 下 Foam-Agent 88.2%,对比 MetaOpenFOAM 55.5%、OpenFOAMGPT-Alt 37.3%;GPT-4o 下 59.1% / 17.3% / 45.5%。 消融:加入 Reviewer Node 使成功率从约 50% 升至 80% 以上。 案例层面用定性方式说明,如外部网格的多段翼型与串列翼结果与专家结果匹配,但无 RMSE 或相对误差等量化拟合指标。

方法

系统由六个 agent 组成。Architect Agent 将自然语言解析为结构化仿真计划,含需求分类、参考算例检索、任务分解。Meshing Agent 支持三种网格模式:OpenFOAM 原生工具、外部网格文件、基于 Gmsh 从几何描述生成。Input Writer Agent 按层级依赖(system → constant → 0 目录)生成配置文件,并用 Pydantic schema 校验。Runner Agent 本地或 HPC 执行,生成 Slurm 脚本,通过日志分析做错误检测。Reviewer Agent 做迭代错误分析与跨文件一致的修复。Visualization Agent 用 ParaView/PyVista 出图。

检索部分用分层 RAG。知识库来自 OpenFOAM 教程,分为算例元数据、目录结构、文件内容、执行脚本四个维度。构建四个 FAISS 索引,向量 1536 维(text-embedding-3-small),按阶段检索 top-k 并过滤。

编排用 LangGraph 管理有状态流程,核心功能通过 Model Context Protocol 暴露为可调用工具,便于与其他系统组合。Pydantic 约束输入输出 schema,LangSmith 提供端到端追踪。

结果/信号

基准为 110 个 OpenFOAM 算例,覆盖 11 个物理类别(层流 30、湍流 20、传热 20、多相 10、燃烧 10、激波动力学 10、浅水 10)。

成功率: - Claude 3.5 Sonnet:Foam-Agent 88.2%,MetaOpenFOAM 55.5%,OpenFOAMGPT-Alt 37.3%。 - GPT-4o:Foam-Agent 59.1%,MetaOpenFOAM 17.3%,OpenFOAMGPT-Alt 45.5%。

消融:加入 Reviewer Node 使成功率从约 50% 升至 80% 以上。文件依赖分析(无 reviewer)48.2% → 56.4%。分层检索(无 reviewer)57.3%,对比基线 44.6%。

案例:外部网格处理多段翼型与串列翼,匹配专家结果。Gmsh 生成圆柱与双障碍流网格。HPC 上运行 3D 方腔,100 万网格,32 子域,使用 Perlmutter 集群。

与 AutoSim 的关系

二者都用 LLM-agent 驱动数值求解器,做端到端任务自动化。Foam-Agent 驱动 OpenFOAM,AutoSim 驱动 COMSOL 做电池 P2D 建模,机制相邻。可借鉴的点:分层 RAG 用领域教程约束配置生成;Reviewer Agent 的迭代错误修复显著提升成功率,对应 AutoSim 中基于验证证据逐轮修改建模假设的循环;用结构化 schema(Pydantic)校验求解器输入,控制配置正确性;通过 MCP 暴露求解能力以便组合。区别:Foam-Agent 以运行成功率为主要指标,未涉及参数识别与留出工况的预测准确性验证,而这是 AutoSim 的核心。

链接

  • arXiv 摘要:https://arxiv.org/abs/2509.18178
  • HTML 全文:https://arxiv.org/html/2509.18178
  • 论文 PDF:paper.pdf
17Evaluating LLMs for Geometry and Simulation File Generation in Physics-Based Simulationsgmsh-elmer-eval

Evaluating LLMs for Geometry and Simulation File Generation in Physics-Based Simulations(gmsh-elmer-eval)

来源:MDPI Applied Sciences, 2025, 15(22), Article 12114。DOI 10.3390/app152212114。出版日期 2025-11-13。

作者/机构:Ossama Shafiq(通讯)、Amin Rahmat、Alessio Alexiadis、Bahman Ghiassi,均来自 University of Birmingham(土木工程、化学工程)。

求解器:Gmsh(几何与网格,.geo)+ Elmer(开源多物理场有限元,.sif)。

类型:LLM 生成仿真输入文件的能力评测(benchmark / evaluation)。

做什么

评估九个 LLM 能否从自然语言提示直接生成有限元仿真所需的两类文件。一类是供 Gmsh 划分网格的几何文件。一类是供 Elmer 求解的输入文件。目标是判断 LLM 能否简化有限元仿真流程。

设计思路

把有限元前处理拆成两层分别评测。第一层是几何文件生成,产物为 Gmsh 的 .geo 脚本。第二层是求解器设置生成,产物为 Elmer 的 .sif 输入文件。两层独立打分,以区分自然语言到几何与自然语言到求解器配置两个环节的能力。求解器设置一层通过实际执行 Elmer 求解,把数值结果与参考解比较。其余维度从文件内容直接评分。(MDPI 正文被 Cloudflare 拦截,评分系统的权重与阈值定义未能核实。)

Agent 解决的问题

减少有限元仿真的手工前处理。用户用自然语言描述算例,LLM 直接产出可执行的几何文件与求解器输入文件,省去手写 .geo 与 .sif 的步骤。论文用单次生成评测各 LLM 完成该任务的能力,不含按反馈迭代修正的循环。

标准输入 / 输出

  • 输入:自然语言提示,描述目标算例的几何与仿真设置。两个标准算例为一根简单的杆(simple bar)和一个轮轴装配体(wheel and axle assembly)。
  • 输出:两类文件。一是 Gmsh 几何文件(.geo),二是 Elmer 求解器输入文件(.sif)。
  • 评测方式:对生成文件按维度打分(文件完整性、布尔运算、形状保真、位移误差)。.sif 文件经 Elmer 实际求解,得到位移误差。具体打分公式与每模型分数未能核实。

能力评价标准

两者结合。规则判定一侧检查文件完整性与布尔运算等内容是否正确,以及 .sif 文件是否可被 Elmer 执行。拟合误差一侧用实际求解后的位移误差对照参考解。

论文实际指标:

  • 多数 LLM 在生成求解器输入文件上成功率 78–88%。
  • 输入文件可执行时,位移误差小于 1%。
  • 几何文件生成结果差异较大。
  • 九个模型的逐模型分数与位移误差阈值定义未能核实(MDPI 正文被拦截)。

方法

设两个标准算例:一根简单的杆,一个轮轴装配体。对每个模型生成的文件打分。评分维度包括文件完整性、布尔运算、形状保真和位移误差。几何生成与求解器设置分别评估。位移误差通过实际执行 Elmer 求解后与参考结果比较得到。

结果/信号

  • 评估 9 个 LLM。
  • 多数模型在生成求解器输入文件上成功率为 78–88%。
  • 输入文件可执行时,位移误差小于 1%。
  • 几何文件生成结果差异较大。
  • 摘要关键词提及 GPT-4 与 LLAMA;九个模型的完整名单与逐模型分数未能从原文核实。

(以上仅为已核实数据。MDPI 正文被站点拦截无法抓取,逐模型结果表未获取。)

与 AutoSim 的关系

机制相邻,但领域不同。该研究面向结构力学有限元(Gmsh+Elmer),AutoSim 面向锂电池 P2D 电化学建模(COMSOL)。两者的共同问题是:LLM 能否从自然语言生成可执行的求解器输入文件,并通过实际求解验证结果。

可借鉴的点有三。第一,把生成产物分为几何和求解器设置两层分别评估,与 AutoSim 区分物理接口设置与几何/网格设置的思路一致。第二,用可执行性加数值误差(位移误差 < 1%)作为通过判据,对应 AutoSim 用前向预测准确性和留出验证作为通过判据。第三,几何生成成功率明显低于求解器设置,提示自然语言到几何的转换是薄弱环节;AutoSim 中对应的薄弱环节是参数识别与机制选择,需类似的明确失败归因。

差异在于该研究停在单次生成评测,不含按验证证据迭代修改建模假设的研究循环。

链接

  • 说明:PDF 未能抓取(MDPI Cloudflare 拦截);正文见 MDPI 在线版。本地仅留 fulltext.md 检索摘录。
  • MDPI 原文:https://www.mdpi.com/2076-3417/15/22/12114
  • DOI:https://doi.org/10.3390/app152212114
  • 机构库:https://research.birmingham.ac.uk/en/publications/evaluating-the-performance-of-large-language-models-for-geometry-/
  • ResearchGate:https://www.researchgate.net/publication/397618726
附件 · fulltext.md

Evaluating the Performance of Large Language Models for Geometry and Simulation File Generation in Physics-Based Simulations

源 URL: https://www.mdpi.com/2076-3417/15/22/12114 DOI: https://doi.org/10.3390/app152212114 机构库镜像: https://research.birmingham.ac.uk/en/publications/evaluating-the-performance-of-large-language-models-for-geometry-/ ResearchGate: https://www.researchgate.net/publication/397618726

注:MDPI 站点对自动抓取返回 HTTP 403(Cloudflare 拦截),无法获取完整正文。 以下内容来自 University of Birmingham 机构库页面与公开检索摘要,均为已核实信息,未做扩充。


书目信息

  • 标题:Evaluating the Performance of Large Language Models for Geometry and Simulation File Generation in Physics-Based Simulations
  • 期刊:Applied Sciences (MDPI)
  • 卷期:2025, 15(22), Article 12114
  • 出版日期:2025-11-13(E-pub ahead of print)
  • DOI:10.3390/app152212114
  • 作者:
  • Ossama Shafiq(通讯作者),Civil Engineering, University of Birmingham
  • Amin Rahmat,Chemical Engineering, University of Birmingham
  • Alessio Alexiadis,University of Birmingham
  • Bahman Ghiassi,University of Birmingham
  • 关键词:geometry; large language models; physics-based simulations; LLAMA; artificial intelligence in engineering design; Gmsh; GPT-4

摘要(检索摘要,整合自机构库与检索片段)

研究评估大型语言模型能否简化有限元仿真流程。作者评估了九个 LLM 从自然语言提示生成两类文件的能力:供 Gmsh 网格划分使用的几何文件(.geo),以及供 Elmer 求解器使用的输入文件(.sif)。

使用两个标准测试算例:一根简单的杆(simple bar),以及一个轮轴装配体(wheel and axle assembly)。引入一套评分标准与打分系统,在几何生成与仿真设置两方面评估性能,涵盖文件完整性(file completeness)、布尔运算(Boolean operations)、形状保真(shape fidelity)和位移误差(displacement error)等维度。

结果显示,多数 LLM 在生成求解器输入文件上表现优秀,达到 78–88% 的成功率;当输入文件可执行时,位移误差小于 1%。几何文件生成的结果差异较大。


已核实的关键数据点

  • 评估模型数量:9 个 LLM。
  • 几何工具:Gmsh(开源几何与网格生成器),生成 .geo 几何文件。
  • 求解器:Elmer(开源多物理场有限元求解器),生成 .sif 求解器输入文件。
  • 测试算例:simple bar;wheel and axle assembly(共 2 个)。
  • 评分维度:file completeness、Boolean operations、shape fidelity、displacement error。
  • 求解器输入文件生成成功率:78–88%。
  • 可执行时位移误差:< 1%。
  • 几何文件生成:结果差异较大(varied results)。

未获取部分

以下内容因 MDPI 正文不可抓取而未能确认,需访问原文核对: - 九个 LLM 的具体名称与逐模型分数(摘要关键词提及 GPT-4 与 LLAMA,但完整名单未确认)。 - 评分系统的权重与阈值定义。 - 各算例、各模型的详细结果表。 - 完整的方法学描述与结论原文。

18Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstructionjutulgpt

Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction

短名:JutulGPT

  • arXiv / 来源:arXiv 2603.00214,https://arxiv.org/abs/2603.00214
  • 作者 / 机构:Knut-Andreas Lie、Olav Møyner、Elling Svee、Jakob Torben(摘要页未列出机构)
  • 求解器:JutulDarcy,基于 Julia 的油藏数值模拟器
  • 类型:agent 编排

做什么

研究 LLM agent 能否作为物理仿真的科学助手。核心问题是自然语言对仿真模型的描述天然欠定。不同的合理补全会产生物理上有效但科学上不同的配置。论文把模型构建组织为执行落地的解释-执行-验证循环。求解器负责验证物理一致性。

设计思路

把求解器当作物理有效性的判定方,而不只是运行环境。把模型构建组织为执行落地的解释-执行-验证循环。自然语言描述天然欠定,agent 显式检测欠定的建模选择,自主补全并记录假设,或向用户提问澄清。求解器跑到完成即视为物理有效性的证明:在 JutulDarcy 中,只有局部和全局质量守恒误差降到容差以下、非线性求解器收敛,仿真才会跑完。这个判据比"代码不报错"更强。

Agent 解决的问题

面向需要用仿真器建模的研究人员。原来要把概念描述翻译成可执行配置,需要人工选择控制方程、本构关系、边界和初始条件、离散和求解器设置,并逐项澄清欠定假设,过程依赖查文档、看示例、读求解器诊断信息反复修正。agent 替用户做文档检索、代码生成、静态检查、执行和诊断解读,并把欠定选择显式提出,省去逐项手工对齐 API、单位和全局约束的工作。

标准输入 / 输出

输入是对仿真模型的自然语言描述或建模意图,例如"建一个 100×100×30 笛卡尔网格、覆盖 1000×1000×50 m 区域的不可压两相非有利驱替"。

输出是可在本地 Julia 环境执行的 JutulDarcy 代码和模型配置。重建案例中还可产出三种文本表示:仿真器专用的复现 prompt、仿真器无关的技术报告、期刊式简述。

能力评价标准

按规则判定。判定方是求解器:代码能否通过静态检查、能否在 Julia 中执行、JutulDarcy 是否跑到完成(质量守恒容差、本构一致性、求解器收敛)。仿真跑完即视为物理有效性证明。案例 2(quarter five-spot,50×50×1 网格)报告"33.2 秒成功执行";案例 3(三维非均质,100×100×30、30 万单元)报告多轮修正后跑完十年仿真,并验证注入恰好 1 个孔隙体积。重建案例(案例 4)未报告与参考解的定量拟合误差,只定性比较重建配置与参考配置的差异(图 7、图 9),如不可压公式导致流体行为明显不同。论文使用 OpenAI GPT-5.2(开启 reasoning、greedy 解码 temperature=0.0),环境为 Julia 1.12.4、Jutul 0.4.16、JutulDarcy 0.3.3。

方法

JutulGPT 分三层。对话层负责对话和意图解析。工具层负责文档检索和代码分析。运行层负责执行和诊断。

工作循环分三步。解释:解析意图,识别欠定选择。执行:检索文档,生成代码,做静态检查。验证:在 Julia 环境中运行,分析求解器诊断信息。

文档检索对 JutulDarcy 文档、docstring 和示例脚本建立索引,使用语义检索和关键词检索。代码在本地 Julia 环境执行,并结构化捕获错误。

结果 / 信号

  • 案例 2(quarter five-spot)使用 50×50×1 网格,完成耗时 33.2 秒。初次代码生成出现构造器不匹配,经迭代修正后成功执行。
  • 案例 3(三维非均质油藏)使用 100×100×30 网格,共 30 万单元,覆盖 1,000×1,000×50 m,三层对数正态渗透率均值为 100、200、900 mD,10 年内注入恰好 1 个孔隙体积。经多轮修正后成功执行。
  • 案例 4(逐级抽象重建)用三种细化程度递减的表示重建参考配置。仿真器无关的技术报告省略了密度-压力关系,重建 agent 选择了不可压缩公式而参考为可压缩模型,导致流体行为明显不同。
  • 论文指出结构性局限:来自仿真器默认值的隐含假设不会出现在假设日志中。文本表示不能唯一确定可执行状态。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模。JutulGPT 与 AutoSim 思路一致:都用求解器作为物理有效性的判定方,agent 负责解释和编排,而不替代求解器。两者都面对自然语言描述欠定的问题,都用执行和求解器诊断来约束并迭代修正建模选择。差异在于 JutulGPT 求解器为 Julia 油藏模拟器,AutoSim 为 COMSOL 电化学接口。JutulGPT 暴露的"仿真器默认值导致隐含假设不可见"问题,对 AutoSim 的参数识别和假设记录有直接借鉴意义。

链接

  • 摘要页:https://arxiv.org/abs/2603.00214
  • 本地全文:paper.pdf
19Lang-PINN:从自然语言到物理信息神经网络的多智能体框架lang-pinn

Lang-PINN:从自然语言到物理信息神经网络的多智能体框架(Lang-PINN)

来源:arXiv:2510.05158(https://arxiv.org/abs/2510.05158)

作者/机构:Xin He、Liangliang You、Hongduan Tian、Bo Han、Ivor Tsang、Yew-Soon Ong。arXiv 摘要页未列出机构隶属。

求解器:物理信息神经网络(PINN)。基于 PyTorch 自动微分实现 PDE 残差损失,参考 DeepXDE、PINNacle 生态。不使用网格化数值求解器。

类型:LLM 多智能体系统,端到端自动构建可训练 PINN。

做什么

把自然语言任务描述直接转成可执行、可训练的 PINN 代码。

针对的问题是 PINN 构建过程繁琐且易出错。用户需要先把问题写成 PDE,再设计网络结构和损失函数,再实现稳定的训练流程。已有 LLM 方法只处理其中孤立的环节,例如代码生成或结构推荐,并且默认 PDE 已经写成形式化形式。Lang-PINN 从非形式化描述出发,覆盖完整流程。

设计思路

核心是把端到端的 PINN 构建拆成四个智能体组成的流水线。第一步把自然语言任务描述转成符号形式的 PDE。第二步根据 PDE 特征选择 PINN 网络结构。第三步模块化生成可执行代码。第四步执行代码并基于反馈迭代修正。四步串联成闭环,前面阶段会被后续反馈修正,主要修正代码生成阶段。模块化和反馈驱动的设计降低错误传播。

Agent 解决的问题

解决从自然语言描述到可训练 PINN 的端到端构建。覆盖完整流程,包括 PDE 形式化、结构选择、代码生成和反馈修正,而不是孤立的单个环节。已有方法默认 PDE 已写成形式化形式,缺少端到端视角。本工作从非形式化描述出发,把科学一致性、可执行性和可训练性作为显式设计目标。

标准输入 / 输出

输入是自然语言任务描述,非形式化形式。输入形态参考自建的 Task2PDE 数据集,由「描述-方程」对组成,覆盖四个语言复杂度等级。

输出是可执行、可训练的 PINN 代码。代码包含模型定义、PDE 损失、数据预处理、训练循环、验证和主函数六个模块。

能力评价标准

能力评价分三类:规则判定(端到端执行成功率)、拟合误差(MSE)、两者结合。

本论文使用两者结合。既报告端到端执行成功率,也报告 14 个 PINNacle PDE 上的 MSE。

具体数值:

  • MSE 较基线降低 3 至 5 个数量级。
  • 端到端执行成功率提升超过 50%。1D/2D 成功率超过 80%,基线通常低于 35%。3D 成功率接近 75%。
  • 迭代/时间开销最多减少 74%。平均 8 次迭代收敛,最差基线 31 次。
  • 单项 MSE 示例(Table 2,10 次平均):1D Burgers 6.48E-05(PINNsAgent 1.10E-04,PINNacle 7.90E-05);KS(1D)1.62E-03(基线 1.09E+00 至 3.33E+00);Poisson-MA(2D)2.25E-03(PINNsAgent 3.16E+00,PINNacle 1.83E+00)。

方法

四个智能体协作:

  • PDE Agent:把自然语言解析成符号形式的 PDE。使用链式推理、模板校验和多次投票。用 AST 树匹配判断符号等价,用嵌入相似度判断语义一致。
  • PINN Agent:免训练地选择网络结构。把 PDE 编码成特征向量(周期性、几何复杂度、多尺度需求),把候选结构编码成能力向量,按加权余弦相似度匹配;相似 PDE 复用历史结果。
  • Code Agent:模块化生成代码。拆成六个独立部分(模型定义、PDE 损失、数据预处理、训练循环、验证、主函数),不做单体生成,以提高可执行性。
  • Feedback Agent:执行代码并诊断错误,迭代修正。从收敛效率、预测准确性、模型复杂度和鲁棒性多个维度评估,做局部修正。

评测使用四个开源 LLM:Llama2、Vicuna、DeepSeek-V3、Qwen。

结果/信号

仅记录论文报告的数值。

  • 基准:来自 PINNacle 的 14 个 PDE(含 Burgers、Wave-C、KS、Heat、Poisson、NS-C、GS 等),维度从 1D 到 ND。
  • 自建 Task2PDE 数据集:8 类 PDE 共 1600 条「描述-方程」对,四个语言复杂度等级。
  • 对比基线:PINNacle、RandomAgent、BayesianAgent、SCoT、Self-Debug、PINNsAgent。
  • MSE 较基线降低 3 至 5 个数量级。
  • 端到端执行成功率提升超过 50%。1D/2D 成功率超过 80%,基线通常低于 35%。
  • 迭代/时间开销最多减少 74%(平均 8 次迭代,最差基线 31 次)。
  • 单项 MSE 示例(Table 2,10 次平均):1D Burgers 6.48E-05(PINNsAgent 1.10E-04,PINNacle 7.90E-05);KS(1D)1.62E-03(基线 1.09E+00 至 3.33E+00);Poisson-MA(2D)2.25E-03(PINNsAgent 3.16E+00,PINNacle 1.83E+00)。

与 AutoSim 的关系

AutoSim 驱动 COMSOL,做锂电池 P2D 电化学建模,求解器是有限元/有限体积网格求解。Lang-PINN 用 PINN,不是网格求解,求解器层面不同。

机制相邻点在多智能体编排上。两者都把建模流程拆成若干角色:把任务转成形式化方程、选择求解配置、生成可执行实现、执行后基于反馈迭代修正。Lang-PINN 的 PDE Agent 对应 AutoSim 中「检查现有物理接口、反应机理、状态变量是否足以表达目标现象」这一步;Feedback Agent 的执行-诊断-修正循环,对应 AutoSim「每轮基于验证证据只改变一个建模假设,再重新求解和验证」的研究循环。

差异在验证逻辑。Lang-PINN 主要以 MSE 等指标衡量预测误差,针对标准 PDE 基准。AutoSim 关注参数是否被训练数据约束、是否经过留出工况验证,以及无法识别时给边界或拒绝输出。可借鉴其用特征向量做结构匹配和历史复用的做法,但需替换为 COMSOL 物理接口和反应机理的匹配。

链接

  • 摘要:https://arxiv.org/abs/2510.05158
  • 全文:https://arxiv.org/html/2510.05158
  • 本地全文:paper.pdf
20MechAgentsmechagents

MechAgents

(开源项目,仅简介,未抓全文)

  • 仓库/来源:https://github.com/lamm-mit/MechAgents (MIT LAMM)
  • 求解器:FEniCS(有限元方法)
  • 类型:开源项目

简介

MechAgents 展示多个 AI agent 协作求解力学问题。基础设计采用双 agent:一个 agent 写代码,另一个执行并反馈,形成写-跑-自纠循环。对较复杂任务,系统扩展为规划、建模、编码、执行、验证等多角色 agent,用于求解不同边界条件和材料行为下的经典弹性力学问题。

与 AutoSim 的关系

与 AutoSim 同为 LLM-agent 驱动求解器。MechAgents 用双 agent 写并运行 FEniCS 有限元代码,靠执行反馈自动纠错。这一写-跑-自纠的最小闭环与 AutoSim 驱动 COMSOL 的循环结构一致,可作为多角色分工的参考。

链接

  • https://github.com/lamm-mit/MechAgents
21MetaOpenFOAM:自然语言驱动 OpenFOAM 的多 agent 框架metaopenfoam

MetaOpenFOAM:自然语言驱动 OpenFOAM 的多 agent 框架(短名:MetaOpenFOAM)

arXiv/来源:arXiv:2407.21320(https://arxiv.org/abs/2407.21320),投稿 Computer Physics Communications。 作者/机构:Yuxuan Chen、Xu Zhu、Hua Zhou、Zhuyin Ren;清华大学航空发动机研究院(Institute for Aero Engine, Tsinghua University)。 求解器:OpenFOAM 10(开源 CFD)。 类型:基于大语言模型的多 agent 框架,输入为自然语言。

做什么

把自然语言需求转成可运行的 OpenFOAM 算例。 覆盖网格预处理、求解、后处理。 需求只给关键信息,如算例名、类别、求解器、网格、边界条件、初始条件。 出错时自动迭代修正,直到通过或达到迭代/成本上限。

设计思路

把单个 LLM 难以处理的 CFD 任务拆给多个角色,用 MetaGPT 的流水线把任务分解为可管理子任务。核心新意是引入 Reviewer 角色构成错误回路,把多 agent 协作与单 agent 简单堆叠区分开。再用 Langchain 的 RAG 把 OpenFOAM 官方文档和教程作为可检索知识,补充通用 LLM 缺失的求解器专业知识。

Agent 解决的问题

OpenFOAM 需要使用者具备编程能力和专业知识,手工配置算例门槛高、工作量大。单个 LLM 难以同时完成几何建模、物理建模和数值方法。该工作把自然语言需求自动转成可运行算例,降低使用门槛,减少人工配置成本。

标准输入 / 输出

输入为自然语言需求,只给关键信息,如算例名、类别、求解器、网格、边界条件、初始条件、时间步与运行参数。例如对 squareBendLiq 用 rhoSimpleFoam 做可压缩仿真,设 endTime=100、deltaT=1、writeInterval=10。 输出为完整可运行的 OpenFOAM 算例输入文件(system、constant、0 目录及 Allrun 脚本),自动执行求解,返回满足需求的仿真结果。

能力评价标准

主要为规则判定,不与真值或 DNS 比较拟合误差。 可执行性(Executability)按 0 到 4 评分:0 网格生成失败;1 网格成功但运行失败;2 可运行但不收敛;3 跑到 controlDict 指定的 endTime;4 完美且满足全部用户需求。1 到 3 由程序自动判定,4 需人工参与判断是否满足需求。 通过判据为可执行性达到 4。每个算例跑 n=10 次,按 pass@1 估计。平均 pass@1=85%,平均可执行性 3.6。最大迭代 20 次,超过仍未达标则判失败。 论文不评判前向预测准确性,无 RMSE 或相对误差指标。

方法

用 MetaGPT 的流水线范式,把任务拆给四个角色。 Architect:解析需求,从数据库检索相似算例,生成输入结构。 InputWriter:按结构写 OpenFOAM 输入文件,按反馈重写。 Runner:写 Allrun 脚本并执行求解,监控运行错误。 Reviewer:分析错误,定位出错文件,把修正意见返回 InputWriter。 循环为:Architect → InputWriter → Runner →(出错)→ Reviewer → InputWriter,直到无错或达上限。 用 Langchain 的 RAG 检索 OpenFOAM 教程数据库。 教程拆成块,建向量库(FAISS),用 OpenAIEmbeddings 嵌入,按相似度检索后与用户消息拼接送入 LLM。 代表性 LLM 为 GPT-4o,temperature 设为 0.01。

结果/信号

测试集含 8 个算例,覆盖 2D 与 3D、可压缩与不可压缩流动,含湍流(DNS、RANS、LES)、传热、燃烧、牛顿与非牛顿流体。 每个算例运行 n=10 次,按 pass@1 评估。 平均通过率 pass@1 = 85%,平均可执行性评分 = 3.6(满分 4)。 平均每个算例 44045 tokens,按 $5/百万 tokens 计,单个算例约 $0.22。 HIT、PitzDaily、Cavity、SquareBendLiq 达可执行性 4,通过率 100%。 BuoyantCavity 通过率 40%,LidDrivenCavity 通过率 60%,为最差两例。 迭代次数与 token 用量的 Pearson 相关系数 0.89,p 值 0.0013。 消融:去掉 Reviewer,pass@1 从 85% 降到 27.5%。 消融:去掉 Review architecture 动作,pass@1 从 85% 降到 70%。 消融:去掉 RAG,pass@1 降到 0。 敏感性:temperature=0.01/0.5/0.99 时 pass@1 分别为 85%、83%、48%。 低随机性给出更稳定准确的结果。

与 AutoSim 的关系

两者都用 LLM agent 驱动外部数值求解器,机制相邻。 MetaOpenFOAM 驱动 OpenFOAM 做 CFD,AutoSim 驱动 COMSOL 做电池 P2D 建模。 共同模式:自然语言需求 → 生成求解器输入 → 自动运行 → 读结果 → 迭代修正。 两者都用检索增强补求解器专业知识,消融显示该组件不可缺。 两者都用一个独立角色审查错误并回传修正,对通过率影响显著。 差异:MetaOpenFOAM 的通过判据是算例可运行并满足需求,不直接评判前向预测准确性与适用范围;AutoSim 强调参数被训练数据约束并经留出工况验证。 可借鉴其角色分工、错误回路与 RAG 设计;其评分体系不含预测准确性与留出验证,需在 AutoSim 中另行补充。

链接

  • arXiv 摘要:https://arxiv.org/abs/2407.21320
  • PDF:https://arxiv.org/pdf/2407.21320
  • 代码(已弃用,迁移至 sim-cli):https://github.com/Terry-cyx/MetaOpenFOAM
  • 论文 PDF:paper.pdf
22MooseAgentmooseagent

MooseAgent

(开源项目,仅简介,未抓全文)

  • 仓库/来源:https://github.com/taozhan18/MooseAgent
  • 求解器:MOOSE(Multiphysics Object Oriented Simulation Environment)
  • 类型:开源项目

简介

MooseAgent 是一个多 agent 系统,自动生成 MOOSE 多物理场仿真的输入文件。它把仿真任务拆分为子任务,用检索增强(RAG)从已有案例中检索相关写法。生成的输入卡经过多轮执行与报错纠正,直到成功求解。

与 AutoSim 的关系

与 AutoSim 同属"LLM-agent 驱动求解器"的思路。MooseAgent 驱动 MOOSE 生成多物理场输入文件,AutoSim 驱动 COMSOL 做电池 P2D 建模,两者都依赖任务拆解、案例检索和报错自纠循环。其检索增强和多轮纠错机制可作为参考。

链接

  • https://github.com/taozhan18/MooseAgent
23MOOSEnger — a Domain-Specific AI Agent for the MOOSE Ecosystemmoosenger

MOOSEnger — a Domain-Specific AI Agent for the MOOSE Ecosystem(短名:MOOSEnger)

  • arXiv/来源:arXiv 2603.04756。摘要页 https://arxiv.org/abs/2603.04756,HTML 全文 https://arxiv.org/html/2603.04756
  • 作者/机构:Mengnan Li、Jason Miller、Zachary Prince、Alexander Lindsay、Cody Permann。摘要页未列机构;作者多为 MOOSE 核心开发者(MOOSE 由 Idaho National Laboratory 主导)
  • 求解器:MOOSE(Multiphysics Object-Oriented Simulation Environment,多物理场面向对象仿真环境)
  • 类型:领域专用 AI agent,自然语言转 MOOSE 输入文件

做什么

把自然语言请求转换为可执行的 MOOSE 输入文件。目标是降低 MOOSE 仿真的搭建和调试门槛。输入文件采用 MOOSE 的 HIT(层级输入文本)语法。

设计思路

核心设计是核心加领域(core-plus-domain)架构加确定性输入校验流程。可复用的 agent 基础设施(配置、注册表、工具调度、检索、持久化、评测)与 MOOSE 专用插件(HIT 解析、语法保持的摄取、输入修复与校验工具、执行后端)分离。在此架构上,系统把检索增强生成(RAG)与一条确定性的输入校验流程(precheck pipeline)结合:先用 RAG 在 MOOSE 文档与示例上检索上下文以约束生成,再用确定性流程对 LLM 生成的 HIT 文件做清洗、语法修复、对象类型名核验和可选执行。论文将这种把生成与求解器反馈闭环、用工具反馈逐步把"近似正确"的输入转为可运行输入的做法,称为优于一次性生成的可靠性来源。

Agent 解决的问题

MOOSE 输入文件搭建和调试门槛高。可用对象数量大,HIT 语法约束严格,首次搭建和排错耗时。LLM 直接生成 MOOSE 输入文件存在两类失败:自由生成产生畸形 HIT 语法;领域幻觉产生不存在的对象 type 名。MOOSEnger 针对这两类失败,在启动昂贵求解之前加入校验层,把语言推理与 MOOSE 专用结构和工具反馈绑定,降低首次可运行所需时间并提高排错效率。

标准输入 / 输出

输入是用户通过命令行界面发出的自然语言仿真请求,通常说明关键物理、几何、边界/初始条件和需要的输出。输出是一个可执行的 MOOSE HIT 输入文件(.i),并附带对建模选择和结果的简短说明。生成的输入文件先经过确定性校验流程:清洗(归一化换行、NFKC 归一化、替换智能标点与不间断空格、移除零宽/控制字符)、语法约束修复(用 moose-pyhit 解析,对畸形 HIT 做有界规则化修复)、语义校验(对照应用语法注册表核验对象 type 名,失配时做语法感知的相似度搜索纠正)、可选执行(-check-input 校验、仅网格运行、或短求解 smoke test)。执行通过本地后端或 MCP 后端,把求解器诊断作为"verify-and-correct"反馈,在有界迭代内循环直到输入文件通过所有检查或耗尽迭代预算。

能力评价标准

评价标准是规则判定,以可执行性为准。Agent 端到端成功的判据是:把最终输入文件经 mcp.run_input 执行,退出码为 0(exit_code=0)记为通过。这是基于执行退出码的规则判定,不比较求解结果与真值或留出数据。

基准为 175 道题,覆盖 7 个物理领域,每个领域 25 题:diffusion、transient heat conduction、solid mechanics、porous flow、incompressible Navier–Stokes、phase field、plasticity。整体上 MOOSEnger 通过 158/175(0.90),LLM-only 基线(ChatGPT 5.2 API,生成时不调用工具)通过 10/175(0.06),约为 15 倍相对提升。逐领域(MOOSEnger vs 基线,Table 1):

  • diffusion:25/25(100%) vs 9/25(36%)
  • transient heat conduction:23/25(92%) vs 0/25(0%)
  • solid mechanics:24/25(96%) vs 0/25(0%)
  • porous flow:23/25(92%) vs 1/25(4%)
  • Navier–Stokes:21/25(84%) vs 0/25(0%)
  • phase field:21/25(84%) vs 0/25(0%)
  • plasticity:21/25(84%) vs 0/25(0%)

RAG 侧用 Ragas 框架计算检索/接地指标。论文给出的示例评测报告(Figure 4)聚合值为:faithfulness 0.767±0.205、answer relevancy 0.518±0.377、context recall 1.000±0.000;context precision 在指标定义中列出,但示例报告的聚合表未给出具体数值,故未明确。

论文明确该判据的局限:pass 衡量可执行性而非完整科学正确性。输入文件可以运行,但仍可能偏离建模意图(例如过简化的边界条件或非预期的材料模型)。即评价不检验求解结果是否与留出工况或真实数据一致。

方法

采用核心加领域(core-plus-domain)架构。可复用基础设施(配置、注册表、工具调度、检索)与 MOOSE 专用插件(解析器、校验器、执行后端)分离。

数据摄取用 pyhit 做语法保持的分块,保留 HIT 块级语义,并从语法树抽取元数据,形成完整输入与单个配置块均可检索的层级。

核心是检索增强生成(RAG)加确定性的输入校验流程(precheck pipeline),顺序为:清洗(NFKC 归一化、移除不可见字符)、语法约束修复(有界规则化编辑修复畸形 HIT)、语义校验(对照应用注册表核验对象类型名)、可选执行(--check-input 或简短求解的 smoke test)。

评测用 Ragas 框架计算 RAG 指标(faithfulness、answer relevancy、context precision/recall);agent 端到端成功以实际执行退出码为 0 衡量。

结果/信号

  • 基准 175 道题,覆盖 7 个物理领域,每个领域 25 题:diffusion、transient heat conduction、solid mechanics、porous flow、incompressible Navier–Stokes、phase field、plasticity。
  • MOOSEnger 执行通过率 158/175(0.90),LLM-only 基线(ChatGPT 5.2 API)10/175(0.06)。
  • 逐领域明细见 Table 1(MOOSEnger vs 基线):diffusion 25/25 vs 9/25、transient heat conduction 23/25 vs 0/25、solid mechanics 24/25 vs 0/25、porous flow 23/25 vs 1/25、Navier–Stokes 21/25 vs 0/25、phase field 21/25 vs 0/25、plasticity 21/25 vs 0/25。

与 AutoSim 的关系

AutoSim 通过 LLM agent 驱动 COMSOL,做电池 P2D 电化学建模。MOOSEnger 与之同属“LLM agent 驱动多物理场求解器”这一方向,但求解器是 MOOSE 而非 COMSOL,任务是生成可执行输入文件而非电化学参数识别与前向预测验证。

可借鉴点:用确定性校验流程(语法修复、对象类型注册表核验、执行 smoke test)对 LLM 输出加硬约束,以执行退出码而非文本相似度衡量成功。这对 AutoSim 中“检查 COMSOL 物理接口、反应机理、状态变量是否足以表达目标现象”以及“输出在求解层面可执行”有参照价值。

差异:MOOSEnger 只评测输入文件能否执行,不评测求解结果是否与留出工况一致;AutoSim 关注前向预测准确性和适用范围,要求参数被训练数据约束并经留出验证。两者的成功判据不同。

链接

  • 摘要:https://arxiv.org/abs/2603.04756
  • HTML 全文:https://arxiv.org/html/2603.04756
  • 本地全文: paper.pdf
24OASiS MCPoasis-mcp

OASiS MCP

⚠ 未核实:仓库(确切链接未知)未访问到

(开源项目,仅简介,未抓全文)

  • 仓库/来源:确切仓库链接未核实。Web 搜索提到 OASiS 是一个 MCP server,但未定位到具体 GitHub 仓库 URL。
  • 求解器:有限元,多后端(搜索结果提到 FEniCSx、deal.II、NGSolve、scikit-fem 等)
  • 类型:开源项目(未核实)

简介

根据 Web 搜索结果,OASiS 被描述为一个 MCP(Model Context Protocol)server,把 AI 编码 agent 连接到多个有限元求解器后端,提供统一接口和跨后端知识。以下内容来自搜索摘要,未经仓库页面核实,可能不准确:声称覆盖约 8 个后端(FEniCSx、deal.II、NGSolve、scikit-fem 等)。具体仓库、功能和指标待核实。

与 AutoSim 的关系

若属实,OASiS 用 MCP 把 agent 与多个有限元求解器解耦,是"agent 驱动求解器"的接口层做法。AutoSim 驱动 COMSOL,可参考其用 MCP 标准化求解器接口的思路。该关系基于未核实信息,需进一步确认。

链接

  • 未核实,暂无确切仓库 URL
25OpenFOAMGPT:用 RAG 增强的大语言模型智能体驱动 OpenFOAM CFDopenfoamgpt

OpenFOAMGPT:用 RAG 增强的大语言模型智能体驱动 OpenFOAM CFD(短名:OpenFOAMGPT)

arXiv/来源:arXiv 2501.06327,https://arxiv.org/abs/2501.06327,提交于 2025-01-10。

作者/机构:Sandeep Pandey、Ran Xu、Wenkang Wang、Xu Chu。arXiv 摘要页未列出机构信息。

求解器:OpenFOAM(开源 CFD 求解器)。

类型:大语言模型智能体,自然语言到完整求解配置,RAG 检索增强,带迭代纠错回路。

做什么

该工作用大语言模型把自然语言指令转成完整的 OpenFOAM 算例配置。配置包括网格、边界条件和求解参数。目标是自动化 CFD 仿真流程,降低使用门槛。覆盖的场景有单相和多相流动、传热、RANS 和 LES 湍流模型。

设计思路

构建一个对话式的 OpenFOAM 专用 agent,由 Builder、Executor 和内部 OpenFOAM agent(Interpreter、Builder、Runner)组成。用 RAG 把 OpenFOAM 教程算例描述作为领域知识嵌入,补通用模型的知识空白。监控运行日志,出错时把错误追加回查询并迭代。论文对比 GPT-4o 与带思维链的 o1-preview,说明推理型模型在复杂任务上更强。还指出该框架可推广到其他求解器。

Agent 解决的问题

OpenFOAM 配置门槛高,需要专业知识和手工操作。单个 LLM 零样本难以生成正确的算例文件,尤其网格字典 blockMeshDict 常出错。该 agent 用 RAG 和迭代纠错把自然语言转成可跑通的算例,降低使用门槛,提高效率。

标准输入 / 输出

输入为自然语言指令,描述流动问题。复杂几何可附带 blockMeshDict 网格文件作为输入,比纯语言更有效。 输出为完整的 OpenFOAM 算例配置(网格、边界条件、求解参数),自动运行求解器并返回结果。还支持参数修改、湍流模型替换、跨平台代码翻译等任务。

能力评价标准

主要为规则判定,不与真值或 DNS 比较拟合误差。 单个算例按能否成功生成并跑通标记成功或失败,失败时指出出错文件(如 blockMeshDict、transportProperties、kinematicCloudProperties 不正确)。 零样本(无 RAG)6 个算例:GPT-4o 成功 1/6,o1-preview 成功 2/6。加 RAG 后多数算例可跑通。成本按迭代次数和 token 价格计:GPT-4o 每场景 0.03 至 0.36 美元,o1-preview 每场景 0.37 至 1.65 美元。o1-preview 单 token 成本约为 GPT-4o 的 6 倍。 论文不评判前向预测准确性,无 RMSE 或相对误差指标。

方法

系统由系统提示词、Builder 模块和 Executor 组成。Builder 读取用户指令,按需查询 RAG 数据库,生成结构化计划。Executor 调度流程,把任务交给大语言模型推理或交给 OpenFOAM 智能体执行。RAG 数据库来自 OpenFOAM 教程算例描述,提供求解器名、算例名和流动类型。运行时监控错误日志。若检测到失败,把错误信息追加到查询里,重新迭代。论文比较了 GPT-4o 和带思维链的 o1-preview 两个模型。

结果/信号

  • 零样本(无 RAG,表 1):GPT-4o 成功 1/6,o1-preview 成功 2/6。
  • 加入 RAG(表 2,共 6 个算例):GPT-4o 迭代 2 到 10 次,每个场景花费 0.03 到 0.36 美元;o1-preview 迭代 1 到 9 次,每个场景花费 0.37 到 1.65 美元。
  • 参数修改(表 3):o1-preview 全部任务成功;GPT-4o 在非稳态边界条件上失败。
  • 湍流模型替换(表 4):o1-preview 在多数算例上成功完成 RANS 和 LES 模型替换。
  • 代码翻译(表 5):o1-preview 在 4 个跨平台翻译任务中成功 3 个。
  • o1-preview 每个 token 成本约为 GPT-4o 的 6 倍,但在复杂任务上表现更好。

与 AutoSim 的关系

两者都是用大语言模型智能体驱动一个数值求解器,机制上相邻。OpenFOAMGPT 驱动 OpenFOAM 做 CFD,AutoSim 驱动 COMSOL 做锂电池 P2D 建模。可借鉴的点:用 RAG 把求解器文档和算例描述作为检索来源,约束生成内容;用迭代纠错回路把求解器报错反馈回模型;用推理型模型处理复杂的参数和模型修改。差异:该工作以算例能否跑通和成本作为成功判据,未涉及前向预测的准确性和留出工况验证;AutoSim 需要在能跑通之外,进一步验证参数可识别性和适用范围。

链接

  • arXiv 摘要:https://arxiv.org/abs/2501.06327
  • HTML 全文:https://arxiv.org/html/2501.06327
  • 论文 PDF:paper.pdf
26PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoningpde-agents

PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoning(简称 PDE-Agents)

  • arXiv/来源:arXiv 2606.07850。https://arxiv.org/abs/2606.07850
  • 作者/机构:Sayan Adhikari、Gulshan Noorsumar、Øyvind Jensen。论文未列出明确机构。
  • 求解器:FEniCSx / DOLFINx(下一代 FEniCS 有限元求解器)。
  • 类型:多智能体框架,用自然语言驱动 PDE/有限元仿真全流程,含知识图谱增强检索。

做什么

用自然语言交互自动完成偏微分方程(PDE)/有限元(FEM)仿真的完整流程。用户用自然语言提出仿真任务,系统自动建立问题、求解、分析并存储结果。目标领域是基于 FEniCSx/DOLFINx 的有限元仿真,案例之一是参数化热方程的瞬态热扩散。

设计思路

用三个职能 LLM 智能体(Simulation、Analytics、Database),由 LangGraph 监督器路由协调,全部模型本地部署。核心新意是 GraphRAG 的"集成方式":知识图谱(Neo4j 加 768 维 HNSW 向量索引)存储整理后的材料性质、已知失败模式(KnownIssue 节点,由纯 Python 规则引擎在求解前触发九条预检)和历史运行谱系。对比三种检索模式 KG On、KG Off、KG Smart,结论是决定 GraphRAG 帮助还是损害智能体的是集成方式而非知识内容:KG Smart 用 warm-start(检索 top-3 相似历史运行注入提示)加惰性查询(仅失败时查 KG),既保住可靠性又拿到最高输出质量。求解用 ReAct 风格推理加自纠正循环,报错时调参重试。

Agent 解决的问题

把自然语言仿真任务自动转成 FEniCSx 求解并存档分析。具体解决:建立 PDE 问题与数值求解(Simulation Agent,最多 25 步 ReAct,配 check_config_warnings、validate_config、run_simulation、debug_simulation 等九个工具);从输出生成统计分析(Analytics Agent);管理知识图谱存储与检索(Database Agent);用 warm-start 注入历史成功运行做少样本参考,降低首次失败率。

标准输入 / 输出

标准输入:自然语言仿真任务(如"用某材料解某域上的瞬态热方程",可只给材料名)。 中间输出:FEniCSx 求解器接受的 HeatConfig JSON 配置(含几何类型、边界条件类型、材料性质、时间积分方案),由 Gmsh 从九类参数化几何库构建域。 标准输出:求解结果(温度场等,VTK/HDF5)、统计分析文本、存入 PostgreSQL 与 Neo4j 的运行谱系。

能力评价标准

两者结合:既有规则判定的求解成功率,也有与解析解、参考性质比对的误差指标。求解成功率:生产规模 1,369 次运行成功率 97.8%、首次成功率 57.6%;消融(50 任务)中 KG Smart 成功率 100%。与真值比对:正式 V&V 研究按 ASME V&V 10-2006,用 DOLFINx 解对三个有解析解的热方程算例,用度数 8 积分算连续 L² 误差,确认二阶空间收敛 O(h²)(实测收敛率 2.04 与 2.00,线性算例 L²≈10⁻⁹ 机器精度)。物理感知指标:材料性质保真度 MPF=1−(1/3)Σ|p_agent−p_truth|/p_truth(KG Smart 0.926 vs KG Off 0.796;虚构材料实验 KG Smart MPF=1.00 vs 无 KG 基线 0.34)、物理质量分数 0.5·MPF+0.5·T_score(检查仿真实际 T_max、T_min 是否落在物理预期范围,KG Smart 0.933 vs KG Off 0.853)。

方法

三个专职 LLM 智能体,由 LangGraph 监督器协调。

  • Simulation Agent:负责 PDE 建立与数值求解执行。
  • Analytics Agent:处理结果并从仿真输出生成分析。
  • Database Agent:管理知识图谱的存储与检索。

LLM 采用本地开源模型栈(Qwen3-Coder-Next、Llama 4 Scout),运行在双 NVIDIA RTX PRO 6000 GPU 上。架构与模型无关,跨两代 LLM 验证。

知识库为 GraphRAG,基于 Neo4j 与 768 维向量嵌入,存储整理后的材料性质、已知失败模式和历史运行谱系。检索模式分 KG On、KG Off、KG Smart 三种,并由自适应框架按任务选择最优检索模式。

求解过程采用 ReAct 风格推理加自纠正循环:遇到求解器报错时调整策略,用调整后的参数重试。

结果/信号

以下数值均来自检索到的摘要与 PDF 全文。

  • 生产指标:1,369 次运行,成功率 97.8%,首次成功率 57.6%。
  • 消融(50 任务,冻结 KG):KG Smart 成功率 100%;物理质量 0.933(KG Smart)vs 0.853(KG Off);材料性质保真度 MPF 0.926 vs 0.796。
  • 新材料实验(3 个仅 KG 知道的虚构材料):KG Smart 的 MPF = 1.00,无 KG 基线为 0.34。
  • KG 增长实验(100 任务):难任务 MPF 提升 8.8%,简单/新材料任务保持在上限。
  • 验证与确认(V&V):热方程求解器二阶空间收敛 O(h^2)。
  • 失败分析:KG On 的三次失败归因于预算耗尽和超时;warm-start 注入是主导的可靠性因素。
  • 核心结论:决定 GraphRAG 增强是帮助还是损害 LLM 智能体的,是集成方式而非知识内容本身。

注:97.8% 成功率、57.6% 首次成功率、1,369 次运行、ReAct 风格自纠正循环均已在检索文本中确认。求解器为 FEniCSx/DOLFINx,而非旧版 FEniCS。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模。PDE-Agents 驱动 FEniCSx 做通用有限元仿真。两者在以下维度可对照。

  • 多智能体编排:PDE-Agents 用 LangGraph 监督器协调建模、分析、数据库三个职能智能体。AutoSim 可参照这种按职能拆分智能体并由监督器统一调度的方式。
  • 知识图谱增强推理:PDE-Agents 用 Neo4j GraphRAG 存储材料性质、失败模式和运行谱系,并按任务选择检索模式。AutoSim 在 COMSOL 物理接口、反应机理、状态变量、参数耦合和历史运行上可借鉴结构化知识库加检索的做法。其结论"集成方式比知识内容更关键"对设计检索注入方式有参考价值。
  • 自纠正循环:PDE-Agents 用 ReAct 风格自纠正处理求解器报错并重试。AutoSim 的研究循环也是每轮基于验证证据只改变一个建模假设再重新求解和验证,二者都依赖求解失败后的迭代修正。
  • 留出验证的差异:PDE-Agents 用 MPF(材料性质保真度)和物理质量分数评估输出。AutoSim 强调参数必须被训练数据约束并经留出工况验证,关注点更偏向参数可识别性与适用范围,而非单次仿真输出质量。

链接

  • 摘要:https://arxiv.org/abs/2606.07850
  • PDF:https://arxiv.org/pdf/2606.07850
  • 全文摘录:paper.pdf
27PDEAgent-Bench:多指标、多库的 PDE 求解器生成基准pdeagent-bench

PDEAgent-Bench:多指标、多库的 PDE 求解器生成基准(简称 PDEAgent-Bench)

来源:arXiv 2605.09636

作者/机构:Zhen Hang、Yushan Yashengjiang、Junhui Li、Huanshuo Dong 等共 25 位作者。机构未在 arXiv 摘要页给出。

求解器:有限元库 DOLFINx、Firedrake、deal.II。

类型:评测基准(benchmark),评估大语言模型与代码智能体从 PDE 描述生成可执行数值求解器的能力。

做什么

该工作构建一个基准,用于检验大语言模型能否从偏微分方程描述直接生成可执行的数值求解器代码。任务输入是 PDE 规格、求解区域、边界条件和评估网格。模型需输出调用专业有限元库的求解代码。基准区分两类字段:智能体可见字段(PDE 规格、网格、区域、边界条件)和评估器专用字段(参考解、校准基线、制造解表达式)。

设计思路

PDE 求解器生成不是语法正确的代码任务。生成的程序可以运行,但仍可能施加错误的物理约束、不收敛或超出资源预算。基准据此把判据从“测试通过”改为“数值结果是否正确求解目标 PDE”。

基准把每个实例拆为智能体可见信息和评估器专用信息。智能体只看到 PDE 规格和自然语言任务描述。参考解、校准基线和制造解表达式隐藏在评估器侧,不暴露给智能体。这样保证所有提交在同一信息条件下被比较。

阈值按实例校准,而非全局固定。不同 PDE 实例的数值难度和计算成本差异大。基准用从参考解单独生成的校准基线给出案例级容差,允许网格分辨率、离散阶数和求解器配置上的合理实现差异。

Agent 解决的问题

基准检验大语言模型与代码智能体能否从 PDE 描述直接生成可执行的数值求解器。任务要求模型把数学模型和边界条件翻译为稳定的离散格式、弱形式或时间推进格式,并正确配置线性或非线性求解器。

基准把评估扩展到离散功能正确性之外,纳入数值精度和计算效率。模型不仅要写出能跑的代码,还要选择合适的数值形式、有限元空间和求解器设置。

基准还检验跨库迁移能力。提供 DOLFINx、Firedrake、deal.II 三条库分轨,覆盖 Python 与 C++ 有限元生态,检验模型能否把求解器合成能力迁移到不同库。

标准输入 / 输出

这是评测基准。输入是任务规格,输出是被评测的求解器代码,基准对输出做三级门控打分。

输入(智能体可见):结构化案例规格 case_spec 与对应的自然语言任务描述。case_spec 定义方程族、计算区域、系数函数、源项、边界条件、初始条件和适用的时间参数。自然语言描述总结 PDE 类型、物理背景、评估网格和可选数值提示。每个实例以 JSONL 记录存储。每个区域在其包围盒上定义输出网格;物理区域外的网格点标记为 NaN,从误差计算中排除。

输出(被评测对象):调用专业有限元库的求解器代码。智能体可自选内部网格、离散方法、时间推进格式和求解器设置。求解器接收 case_spec,通过统一接口在评估网格上返回数值解。评估只要求返回解具有正确的输出格式和维度。

打分(三级顺序门控):生成的求解器在隔离环境中执行,按顺序检查可执行性、数值精度、运行效率。三关全过才计为通过。

能力评价标准

判据是规则判定与拟合误差两者结合,按顺序构成三级门控。

第一级 可执行(规则判定):代码无错误运行,返回格式和维度正确的解。这是规则判定。

第二级 精度(拟合误差):相对 L² 误差 e(u) = ‖u − u_GT‖₂ / ‖u_GT‖₂ 不超过阈值 τ_acc。参考解 u_GT 为零时改用绝对 L² 误差,避免除零。阈值 τ_acc = max(α_acc · e_base, τ_min),其中 e_base 是校准基线误差,默认 α_acc = 10,τ_min = 10⁻⁶。这是拟合误差判据。

第三级 效率(规则判定加基线):墙钟时间 t_agent 不超过阈值 τ_time = α_time · t_base,其中 t_base 是校准基线运行时间,默认 α_time = 3。为减小短运行与环境噪声影响,每个求解器执行多次并取平均运行时间。

e_base、t_base 从单独生成的校准基线得出,与用于打分的参考解 u_GT 分开。这三组默认阈值参数在所有模型和实例上固定。

主指标是案例级通过率 pass_rate(m) = (1/|D|) Σ case_pass_i(m),即三门全过的库实例占比。基准另报告执行通过率、精度通过率、效率通过率,用于定位失败阶段。

方法

基准含 645 个 PDE 实例,覆盖 11 个方程族(Poisson、Helmholtz、Biharmonic、线弹性、Heat、对流扩散、反应扩散、Stokes、Navier–Stokes、Burgers、Wave)和 6 个数学类别,14 种区域模板。

按库分轨:DOLFINx 645 个(主轨,全覆盖),Firedrake 510 个,deal.II 313 个(跨库轨)。

评估采用三级顺序门控:先检查可执行性,再检查数值精度,最后检查运行效率。三关全过才算通过。

  • 精度门:相对 L² 误差 e(u) ≤ τ_acc,其中 τ_acc = max(10 × e_base, 10⁻⁶)。
  • 效率门:墙钟时间 t ≤ τ_time,其中 τ_time = 3 × t_base。
  • e_base、t_base 是从参考解单独生成的校准基线。

主指标是案例级通过率,即三门全过实例占比。参考解优先取解析表达式,否则用细化网格、更严容差的高精度数值解。实验在单节点 CPU 服务器(AMD EPYC 7K62,32 核,62 GB)上跑,单例超时 300 秒。

结果/信号

DOLFINx 主轨单次生成(无执行反馈)通过率:

  • Gemini 3.1 Pro:54.1%
  • Opus 4.7:47.8%
  • GPT-5.4:46.0%
  • CodePDE(代码智能体):44.7%
  • OpenHands(代码智能体):43.6%
  • Qwen3.6-Plus:23.4%
  • DeepSeek V3.2:4.2%
  • Mini-SWE:3.7%

跨库下降明显。Gemini 3.1 Pro 在 Firedrake 降至 32.4%,在 deal.II 降至 32.3%。GPT-5.4 在 deal.II 仅 19.2%。从 Python 库迁到 C++ 库 deal.II,强模型下降约 15–25 个百分点。

失败阶段:弱模型主要卡在可执行性,DeepSeek V3.2 与 Mini-SWE 约 96% 的失败发生在执行阶段。强模型更多卡在精度与效率,Gemini 3.1 Pro 在 Firedrake 的精度失败率 40.2%,在 deal.II 的超时失败率 35.1%。

方程族差异:最易的 Biharmonic,Gemini 在 DOLFINx 达 77.2%;Helmholtz,Opus 达 62.9%。最难的 Stokes,多数系统低于 25%,GPT-5.4 仅 34.4%。

加执行反馈(三次迭代,只给报错不给参考解),GPT-5.4 在 DOLFINx 从 46.0% 升到 59.8%(+13.8),Firedrake 从 38.0% 到 43.7%(+5.7),deal.II 从 19.2% 到 26.8%(+7.6)。

给出求解器骨架的模板消融,Gemini 3.1 Pro 提升有限(DOLFINx +2.2,Firedrake +2.9,deal.II +3.5 个百分点),说明瓶颈在数值形式、有限元空间选择和求解器配置,而非库 API 复杂度。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模,目标是参数识别与前向预测,并经留出工况验证。PDEAgent-Bench 与之机制相邻:两者都让模型生成可执行的数值求解代码,并以数值结果而非语法正确性作为评判。

可借鉴的设计:

  • 三级门控(可执行、精度、效率)与 AutoSim 的“验证证据”思路一致。AutoSim 可参照其将通过判据拆为顺序关卡的做法。
  • 校准基线(e_base、t_base)给阈值,允许实现差异。AutoSim 设定预测准确性判据时可借鉴这种相对容差。
  • 跨库迁移下降说明:模型对具体求解库的依赖很强。AutoSim 锁定 COMSOL 单一平台,可规避此风险,但也意味着结果不能直接迁移到其他库的结论。
  • 难点集中在数值形式选择(Stokes 等耦合系统),提示 AutoSim 在 P2D 多物理耦合(电荷守恒、物质传递、电化学反应)上同样需关注弱形式与求解策略,而非仅靠生成可运行代码。

差异:PDEAgent-Bench 评测通用 PDE 求解器生成,覆盖多方程族;AutoSim 聚焦电化学 P2D 单一物理体系,强调参数被训练数据约束并经留出验证,无法识别时给边界或拒绝输出。

链接

  • 摘要页:https://arxiv.org/abs/2605.09636
  • 全文(HTML):https://arxiv.org/html/2605.09636
  • 本地全文:paper.pdf
28PhyNiKCE:神经符号 agentic 框架驱动自主 CFDphynikce

PhyNiKCE:神经符号 agentic 框架驱动自主 CFD(短名:PhyNiKCE)

arXiv/来源:arXiv 2602.11666,https://arxiv.org/abs/2602.11666

作者/机构:E Fan、Lisong Shi、Zhengtong Li、Chih-yung Wen。机构在 arXiv 摘要页未列出。

求解器:OpenFOAM(simpleFoam、rhoCentralFoam、sonicFoam)。

类型:神经符号 agent 框架,神经规划与符号校验解耦。

做什么

针对 LLM 驱动 CFD 的可靠性问题。LLM 是概率模型,难以满足守恒律和数值稳定性。纯语义 RAG 按文本相似度检索,会得到语言上合理但物理无效的配置,作者称为语义-物理脱节。PhyNiKCE 在执行求解前强制物理约束,减少无效配置。

设计思路

把仿真配置当作约束满足问题,把神经规划与符号校验解耦。核心是符号知识引擎作为确定性护栏:先离线把 OpenFOAM 教程归一化为结构化知识库,再用确定性 RAG 引擎在生成前校验 LLM 给出的配置是否满足物理约束。新意在用确定性、可审计的规则检索替代纯语义向量检索,针对向量分词把 nutUSpaldingWallFunction 切成 nut/U/Spalding 这类碎片导致的上下文中毒。以 ChatCFD 架构为基线,用 Gemini-2.5-Pro/Flash 做后端。

Agent 解决的问题

LLM 是概率模型,难以满足守恒律和数值稳定性,求解器对单个语法错误或数值格式与边界条件不匹配就会失败。纯语义 RAG 按文本相似度检索会得到语言合理但物理无效的配置。在复杂非教程工况下,SOTA 模型零样本准确率不足 1%。PhyNiKCE 用符号校验在执行前强制物理约束,用知识驱动初始化替代试错,降低反思轮数和 token 成本。

标准输入 / 输出

输入为多模态用户输入:自然语言指令、CFD 文献 PDF、CFD 网格文件。系统从中抽取求解器、湍流模型、来流条件等核心物理特征。 输出为完整可执行的 OpenFOAM 算例配置(0/ 初始与边界条件、constant/ 物理与湍流属性、system/ 数值格式与求解器设置),在 OpenFOAM 上执行,出错时进入最多 30 轮的反思循环修正。

能力评价标准

两者兼有:规则判定加与参考解的配置一致性判定。 执行率(Execution Rate)为规则判定:算例运行至少 10 个时间步或迭代而不崩溃的比例,PhyNiKCE 81%、Baseline 58%、标准向量 RAG 12%。 准确率(Accuracy):成功运行且产出的物理结果严格匹配参考文献规定的比例,是与参考工况设定的一致性判定,论文未给 RMSE 等数值误差。总体准确率从 Baseline 的 26% 提升到 Full PhyNiKCE 的 51%(相对提升 96%,即 26%→51%,不是 96% 的准确率);标准向量 RAG 仅 5%。分层准确率:不可压缩流 62%、可压缩流 40%、k-ω SST 63%、k-ε 44%。 效率:反思循环从 22.11 轮降到 9.06 轮(降 59%),token 从 181.2k 降到 151.2k(降 17%)。验证规模 100 次运行、13 个唯一配置,几何为 NACA 0012 翼型与 de Laval 喷管。

方法

把仿真配置当作约束满足问题。框架把神经规划与符号校验分开。

符号知识引擎分三步建库。先把 OpenFOAM 字典归一化为 JSON。再识别物理特征,包括求解器类型、湍流模型、可压缩性。再从 C++ 源码抽取约束。

确定性 RAG 引擎用五种专用检索器,分别处理约束松弛、多物理兼容、模板聚合、双路增强、关键词纠错。

结果/信号

以下为论文报告的数值。

  • 总体准确率从 26%(Baseline)提升到 51%(Full PhyNiKCE),相对提升 96%。
  • 执行率:PhyNiKCE 81%,Baseline 42%。
  • 反射循环从 22.11 轮降到 9.06 轮,下降 59%。
  • Token 消耗从 181.2k 降到 151.2k,下降 17%。
  • 分层准确率:不可压缩流 62%,可压缩流 40%,k-ω SST 63%,k-ε 44%。
  • 基线对比:标准向量 RAG 5%,ChatCFD 26%。
  • 验证规模:100 次运行,13 个唯一配置。
  • 几何:NACA 0012 翼型、de Laval 喷管。
  • 湍流模型:Spalart-Allmaras、k-ω SST、k-ε。
  • LLM:Gemini-2.5-Pro/Flash。

与 AutoSim 的关系

该工作与 AutoSim 都是用 LLM agent 驱动物理求解器,机制相邻。可借鉴点如下。

把求解器配置当作约束满足问题,在求解前做符号校验。这与 AutoSim 在前向预测前检查 COMSOL 物理接口、反应机理、状态变量和参数耦合是否足以表达目标现象的思路一致。

从源码和字典抽取确定性约束,减少检索到物理无效配置的风险。AutoSim 可参考用确定性规则约束 COMSOL 接口和参数组合,而非只靠语义检索。

用知识驱动的初始化替代试错循环,降低自我纠正轮数和 token 成本。对应 AutoSim 的研究循环:每轮基于验证证据只改一个建模假设,再重新求解和验证。

区别:该工作以执行成功率和配置有效性为指标,不涉及参数识别和留出工况验证;AutoSim 关注参数是否被训练数据约束并经留出验证。

链接

  • 摘要页:https://arxiv.org/abs/2602.11666
  • 全文:https://arxiv.org/html/2602.11666
  • 论文 PDF:paper.pdf
29PINNsAgent:用大语言模型自动构建 PINN 求解 PDEpinnsagent

PINNsAgent:用大语言模型自动构建 PINN 求解 PDE(简称 PINNsAgent)

来源:arXiv 2501.12053,提交于 2025 年 1 月 21 日,分类 cs.CE。(标题原文 "PINNsAgent: Automated PDE Surrogation with Large Language Models"。任务主题与预期一致。)

作者/机构:Qingpo Wuwu、Chonghan Gao、Tianyu Chen、Yihang Huang、Yuekai Zhang、Jianing Wang、Jianxin Li、Haoyi Zhou、Shanghang Zhang。机构在所抓取的 arXiv 摘要页未列出,未核实。

求解器:Physics-Informed Neural Networks(PINN)。不调用传统数值求解器,用神经网络拟合 PDE 解。

类型:多智能体框架 + LLM 驱动的 PINN 架构与超参数自动搜索。

做什么

自动为给定 PDE 构建并调优 PINN,替代人工试验和经验调参。目标是缩小领域知识与深度学习经验之间的差距,让非专家也能得到接近专家水平的 PINN 配置。

设计思路

核心是把人工调 PINN 的过程拆成两步并交给 LLM 智能体自动完成。第一步是 Physics-Guided Knowledge Replay(PGKR),把 PDE 的数学和物理特征编码为加权特征向量,从历史实验知识库中检索结构相似的 PDE,取其最优配置作为搜索起点。第二步是 Memory Tree Reasoning Strategy(MTRS),把超参数搜索建模为蒙特卡洛树搜索,用记忆树组织各超参数维度,由 LLM 作为策略模型选择待探索分支,用负测试 MSE 作为回报反向传播更新 Q 值。两步配合,先用历史经验给出次优起点,再用树搜索细化到全局最优配置。

Agent 解决的问题

替代为给定 PDE 人工试验和经验调参的过程。系统自动完成 PINN 的网络架构选择和超参数搜索,包括网络类型、激活函数、宽度、深度、优化器、初始化方式、学习率等。目标是缩小领域知识与深度学习经验之间的差距,让非专家也能得到接近专家水平的 PINN 配置。

标准输入 / 输出

输入是 PDE 的描述。编码的特征包括方程类型(抛物/椭圆/双曲)、空间维度、是否线性、是否含时间、边界与初始条件、系数类型、时间尺度、几何复杂度,共 20 个 PDE、33 维特征。

输出是 PINN 的网络配置和可执行训练代码。配置以 YAML 形式给出,包含优化器、学习率、模型深度、宽度、网络类型、激活函数等字段。Config Generation 模式套用预定义代码模板执行;Code Generation 模式针对知识库中没有的新 PDE 生成可执行代码。

能力评价标准

评价方式分为:规则判定(代码可执行/跑通)、拟合误差(测试 MSE)、两者。本文主要用拟合误差评价。指标是 14 个基准 PDE 上的测试 MSE,每个结果取 10 次运行平均,误差越低越好。

实际示例(PINNsAgent 对比 PINNacle 基准):

  • 1D Burgers:6.51E-05 对 7.90E-05
  • NS-C:8.50E-06 对 2.33E-05
  • Heat-MS:3.57E-05 对 5.27E-05
  • Heat-ND(3D):3.51E-07 对 8.52E+00
  • 2D Heat-CG:1.80E-03 对 8.53E-04(此例基准更优)
  • Wave-C:3.33E-02 对 3.01E-03(此例基准更优)

PINNsAgent 在 14 个 PDE 中的 12 个上取得最佳。消融实验中,同时去掉 PGKR 和 MTRS 会在 GS 上严重失败(MSE 2.59E+08,对照完整框架 4.31E-03)。代码可执行性由 Programmer 的 debug 循环保证,但本文未把"是否跑通"单列为独立指标。

方法

包含两个核心组件。

第一,Physics-Guided Knowledge Replay(PGKR)。把 PDE 特征编码为加权特征向量,特征包括方程类型、空间维度、线性与否、是否含时间、边界条件、几何复杂度。用加权余弦相似度从约 3000 条历史实验的知识库中检索相似 PDE,取 top-K 配置作为起点。

第二,Memory Tree Reasoning(MTRS)。把超参数搜索建模为蒙特卡洛树搜索,包含选择(UCT)、扩展、模拟、反向传播四个阶段,用负的测试 MSE 作为回报更新 Q 值。

多智能体结构包括:Database(实验日志与文献库)、Planner(LLM 生成候选架构,受 MTRS 引导)、Programmer(把设计翻译成可执行代码)、Code Bank(存可复用实现)。系统有 Config Generation 模式(套用预定义代码模板)和 Code Generation 模式(针对新 PDE)。

搜索空间:网络类型 FNNs/LAAFs/GAAFs;激活函数 Elu/Selu/Sigmoid/SiLu/ReLU/Tanh/Swish/Gaussian;宽度 8–256;深度 3–10;优化器 SGD/RMSprop/Adam/AdamW/MultiAdam/L-BFGS;学习率 10⁻⁶ 到 10⁻¹。

工作流程:用 PDE 描述检索相似配置,Planner 生成 YAML 配置,Programmer 执行训练并提取结果,更新数据库,每个 PDE 最多迭代 5 次。

结果/信号

在 14 个基准 PDE 上评测,每个结果取 10 次运行平均。误差越低越好。

部分数据(PINNsAgent 对比 PINNacle 基准):

  • 1D Burgers:6.51E-05 对 7.90E-05
  • NS-C:8.50E-06 对 2.33E-05
  • Heat-MS:3.57E-05 对 5.27E-05
  • Heat-ND (3D):3.51E-07 对 8.52E+00
  • 2D Heat-CG:1.80E-03 对 8.53E-04(此例基准更优)
  • Wave-C:3.33E-02 对 3.01E-03(此例基准更优)

PINNsAgent 在 14 个 PDE 中的 12 个上取得最佳。在 NS-C 等复杂方程上比基线好若干数量级。消融实验中,同时去掉 PGKR 和 MTRS 会在 GS 上严重失败(MSE 2.59E+08,对照 4.32E-03)。

ICML 2025:所抓取的 arXiv 页 Comments 字段只写 "9 pages, 3 figures, 3 tables",未确认 ICML 2025 录用,会议信息未核实。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模,用现有物理接口、反应机理、状态变量做前向预测并在留出工况上验证。PINNsAgent 不调用数值求解器,而是用 PINN 拟合 PDE 解,求解范式不同。

机制邻近点在多智能体编排与历史经验复用。PINNsAgent 的 Database/Planner/Programmer/Code Bank 分工,以及把求解过的问题特征和最优配置结构化存入知识库、再检索迁移到相似问题的做法,与 AutoSim 用 LLM 智能体编排建模、复用历史建模假设的思路相邻。其 MTRS 把超参数搜索建模为带反向传播回报的树搜索,可对照 AutoSim 每轮只改一个建模假设、再重新求解和验证的研究循环。

差异在验证语义。PINNsAgent 用测试 MSE 直接作为搜索回报和最终指标,未涉及对参数可识别性、留出工况验证或适用范围的判断。AutoSim 要求参数被训练数据约束并经留出验证,无法识别时给边界或拒绝输出,这是 PINNsAgent 未覆盖的部分。

链接

  • 摘要页:https://arxiv.org/abs/2501.12053
  • HTML 全文:https://arxiv.org/html/2501.12053
  • 本地全文:paper.pdf
30MCP-SIM:自纠正多 agent LLM 物理仿真框架self-correcting-multiagent-fenics

MCP-SIM:自纠正多 agent LLM 物理仿真框架

短名:MCP-SIM(自纠正多 agent FEniCS)。

英文标题:A Self-Correcting Multi-Agent LLM Framework for Language-Based Physics Simulation and Explanation。

arXiv/来源:npj Artificial Intelligence(正式版,DOI 10.1038/s44387-025-00057-z,正文需登录);Research Square 预印本 rs-7313618 v1(已取得正文,2025-08-14 发布)。本文事实依据来自预印本 PDF。

作者/机构:Donggeun Park、Hyeonbin Moon、Seunghwa Ryu,均来自韩国科学技术院(KAIST)。

求解器:FEniCS(有限元 PDE 求解平台),Python 3.9,沙箱环境本地运行。

类型:自然语言到仿真的多 agent LLM 框架。底层模型为 GPT-4o,编排用 LangChain,不做任务微调。

做什么

把模糊或不完整的自然语言描述转成可执行的有限元仿真。

输入可以缺少控制方程、边界条件或材料属性。

系统推断缺失设定,生成 FEniCS 代码,执行,诊断失败并自动修正。

最后生成多语言的解释报告,说明物理原理和建模选择。

目标场景是学生和非专家用户。

设计思路

核心是用自纠正多 agent 替代一次性代码生成。系统设六个专用 agent,由记忆中心编排器统一调度,所有 agent 通过 JSON 格式的共享全局记忆通信,不直接互相调用。控制流是 Plan → Act → Reflect → Revise 循环:先由输入澄清 agent 推断缺失的几何域、控制 PDE 和边界条件并写入全局记忆,再生成 FEniCS 代码、执行、把失败解释为物理原因并修正,循环直到满足收敛判据。全局记忆持久记录提示历史、问题澄清、代码迭代、诊断日志和最终结果,使各 agent 能基于完整轨迹决策,避免重复计算。底层模型为 GPT-4o,用 LangChain 编排,不做任务微调,仅靠提示工程和工具编排实现自主仿真。

Agent 解决的问题

解决从模糊或不完整自然语言描述自动生成可靠有限元仿真的问题。已有方法(一次性代码生成、自主仿真 agent、物理信息神经网络)通常假设输入已良定,缺乏纠错、迭代和科学解释能力。本文针对的输入常缺少控制方程、边界条件或材料属性,需要系统自行推断缺失设定、在执行失败时自动诊断并修正,并向非专家用户解释建模选择。

标准输入 / 输出

输入是一句自然语言任务描述,可能缺少控制方程、边界条件或材料属性。例如"在含中心圆的方形域中模拟裂纹扩展",不给数值、PDE 形式或边界条件。

输出包括三部分:可执行的 FEniCS Python 代码(覆盖网格生成、函数空间定义、弱形式装配、非线性求解器执行)、仿真执行结果(应力/位移/温度等物理场,满足收敛判据)、多语言解释报告(含 PDE 符号摘要、物理推理、代码注释,支持英语、韩语、日语、德语)。

能力评价标准

属于规则判定。成功标准是规则化的通过/失败,不是相对真实实验数据的拟合误差。具体指标:12 任务基准上的求解率,消融从 6/12 → 8/12 → 10/12 → 12/12(100%)逐步提升;收敛效率以 Plan–Act–Reflect–Revise 循环次数衡量,完整系统通常在少于 5 次循环内收敛,基线常不收敛或需十几次;各仿真满足物理收敛判据,残差低于 10⁻⁶。

第 12 级相场断裂任务,经 10 次自纠正循环后,裂纹起裂与扩展方向与 ABAQUS 结果接近一致。这是与已发表参考解的定性比对,不是真实实验数据,也不是数值化的拟合误差阈值。论文声明未使用任何实验或观测数据。因此评价标准以规则判定(求解成功、收敛、残差阈值)为主,辅以与参考解的定性比对,没有相对真实数据的 MAPE 或 RMSE 等拟合误差指标。

方法

系统包含六个专用 agent,由一个记忆中心编排器协调。

六个 agent 是:输入澄清 agent、代码构建 agent、仿真执行 agent、错误诊断 agent、输入重写 agent、机理洞察 agent。

输入澄清 agent 推断几何域、控制 PDE(如 Navier–Stokes)和边界条件,写入全局记忆作为问题规范。

代码构建 agent 用带物理启发式的提示模板生成 FEniCS 代码,覆盖网格生成、求解器配置和边界条件。

仿真执行 agent 在沙箱中运行代码,监控守恒违背、残差发散和非物理振荡等指标。

错误诊断 agent 把失败解释为物理原因(如网格分辨率不足、求解器不匹配),提出加密网格、缩小时间步、调整求解器参数等修正。

输入重写 agent 在提示本身有歧义时语义改写指令,控制循环从澄清步重启。

机理洞察 agent 在成功后生成报告,含 PDE 符号摘要、物理推理和代码注释。

各 agent 不直接互相调用,全部通过编排器和 JSON 格式的共享全局记忆通信。

核心是 Plan → Act → Reflect → Revise 控制循环,替代一次性代码生成。

结果/信号

基准为 12 个任务,按难度分三档:简单(1–4 级,单物理场、完整输入)、中等(5–9 级,需推断缺失输入)、困难(10–12 级,多物理场、缺失假设)。

物理域覆盖线性弹性、热传导、流体流动、热-机械耦合、压电变形、相场断裂。

消融结果:GPT-4 一次性生成基线解 6/12;加入输入澄清 agent 升到 8/12;再加错误诊断 agent 升到 10/12;完整 MCP-SIM 达到 12/12(100%)。

收敛效率:完整系统通常在少于 5 次 Plan–Act–Reflect–Revise 循环内收敛;基线常不收敛或需十几次。

各仿真满足收敛判据,残差低于 10⁻⁶。

12 级(相场断裂):从单句提示"在含中心圆的方形域中模拟裂纹扩展"出发,顶边上移 5%、底边固定,经 10 次自纠正循环;裂纹起裂与扩展方向与 ABAQUS 结果接近一致。

报告语言含英语、韩语、日语、德语。

与 AutoSim 的关系

AutoSim 用 LLM agent 驱动 COMSOL,做锂电池 P2D 电化学建模;本文用 LLM agent 驱动 FEniCS,做通用力学/热学/多物理场仿真。

两者都把自然语言转成求解器代码,并用多 agent 分工和自纠正循环替代一次性生成。

可借鉴点:六 agent 分工、记忆中心编排、Plan–Act–Reflect–Revise 循环、把执行报错解释为物理原因再修正。

差异点:本文求解器是 FEniCS(脚本式有限元),AutoSim 是 COMSOL(物理接口);本文不做参数识别和留出验证,验证仅靠与 ABAQUS 等已发表结果做定性比对,残差判据为数值收敛而非前向预测准确性。

本文未涉及电化学、P2D 模型或电池工况,也未做参数识别或适用范围界定。

注意:本文用"reproduce/validate 已发表仿真"的方式确认正确性,属于与参考解的定性比对,不构成对实验数据的前向预测验证。

链接

  • 正式版(npj Artificial Intelligence):https://www.nature.com/articles/s44387-025-00057-z
  • 预印本(Research Square rs-7313618 v1):https://www.researchsquare.com/article/rs-7313618/v1
  • 预印本 DOI:https://doi.org/10.21203/rs.3.rs-7313618/v1
  • 代码:https://github.com/KAIST-M4/MCPSIM/tree/main
  • 本地全文: paper.pdf
31SIGA: Self-Evolving Coding-Agent Adapters for Scientific Simulationsiga

SIGA: Self-Evolving Coding-Agent Adapters for Scientific Simulation

短名:SIGA

  • arXiv / 来源:2606.09774
  • 作者 / 机构:Matthew Ho, Brian Liu, Jixuan Chen, Audrey Wang, Lianhui Qin;University of California, San Diego
  • 求解器:GEOS(地下多物理场仿真,主测);迁移到 OpenFOAM、LAMMPS
  • 类型:agent 编排(在通用编码 agent 上加轻量适配器,非微调模型)

做什么

把仿真器建模任务看作接口对接问题。通用编码 agent 能写代码,但不熟悉仿真器专用的输入语言、结构约束和校验规则。SIGA 在不重写 agent 主循环的前提下,给现成编码 agent 注入仿真器专用知识,使其能直接生成可运行的仿真输入文件。

设计思路

把仿真器建模看作接口对接问题,不重写编码 agent 主循环,只在三个接口注入仿真器专用知识:上下文、工具、终止条件。现代编码 agent 已具备文件浏览、代码编辑、命令执行和报错修复能力,缺的是仿真器的可执行约定:专用词汇、结构约束、校验规则和终止条件。SIGA 把这层约定拆成四个可开关组件(检索、程序性记忆、轨迹内校验、终止校验),以轻量适配器形式接入,可移植到不同求解器,并支持自演化改写适配器内容。

Agent 解决的问题

针对的是仿真任务的建立阶段。研究者把自然语言仿真目标翻译成仿真器专用输入语言时,要读文档、找示例、试数值设置、调错误配置,耗时数小时到数天。论文中 GEOS 文档 646 页、18.9 万词,XML schema 约 8000 行、263 种元素、732 个属性,任务平均含 40 多个数值。人类专家不限时完成一个代表性任务约 180 分钟。SIGA 让编码 agent 在约 5 分钟内产出同等质量的输入文件,约 36 倍提速,省去人工查文档和反复调试。

标准输入 / 输出

输入:自然语言仿真任务描述(simulation brief),外加可检索的仿真器文档、schema、示例文件和网格文件。输出:可运行的仿真器输入文件。GEOS 上是完整 XML deck(一个或多个 XML 文件,覆盖网格、几何、物理模块、材料模型、计算区域、数值方法、事件调度、输出等十个标准段);OpenFOAM 上是 case 目录所需文件;LAMMPS 上是 input 文件。终止前经 schema 校验,阻止输出不完整或不可解析的文件。

能力评价标准

按规则判定,不验证前向预测准确性。主指标 TreeSim 为 0 到 1 的递归树相似度,把生成文件与参考文件都解析成 XML 树,逐节点比较标签、属性和子节点结构相似度(公式 α=0.3、β=0.1)。解析失败、超时、缺 XML 输出、空输出一律记 0 分。配套的规则类指标包括 schema 校验是否通过、零分率(zero-score rate)、文件覆盖率(coverage)。

具体数值:GEOS 留出集平均 TreeSim 由 0.720(vanilla)升至 0.789(自演化,+0.069),跨运行标准差由 0.081 降到 0.002–0.005(约 16 倍方差下降)。OpenFOAM 30 任务,SIGA 最优组合(R+S)均分 0.870、30/30 全覆盖、0 个零分,优于 Foam-Agent 2.0(0.516,19/30 覆盖,8 个零分)和 MetaOpenFOAM(0.379,10/30 覆盖,12 个零分)。LAMMPS 9 任务用 LLM 评分 0–10:DeepSeek 由 4.56 升到 7.78,Claude 由 6.33 升到 6.89。人类对照:专家不限时 deck 级 TreeSim 0.931、约 180 分钟;SIGA(X+M)≥0.90、约 5 分钟。指标只衡量文件结构相似度,不衡量仿真结果是否物理正确,也不做留出工况验证。

方法

SIGA 是一个轻量适配器,改动现有编码 agent 的三个接口:上下文、工具、终止条件。包含四个可开关组件:

  • 检索 R:对仿真器文档、schema 和示例做语义检索,经 MCP 工具调用。
  • 程序性记忆 M:一份 775-token 的速查表,注入系统提示,含物理模块、单元名称和示例。
  • 校验工具 X:agent 可调用的 XML schema 校验(xmllint)。
  • 终止校验 S:在终止时强制校验,阻止输出不完整的文件。

GEOS 上用 46 个任务,做 2⁴⁻¹ 部分因子设计(8 个组合)加手选组合与自演化变体。评测指标 TreeSim 为递归树相似度,比较生成文件与参考文件的结构和属性。基线为关闭全部组件的 vanilla Claude Code。

结果 / 信号

  • GEOS 留出集:平均 TreeSim 由 0.720 升至 0.789(+0.069);跨运行标准差由 0.081 降到 0.002–0.005(约 16× 方差下降)。增益主要来自挽救空输出/不可解析的灾难性失败,而非整体质量提升。
  • 人类对照:专家不限时 deck 级 TreeSim 0.931、耗时约 180 分钟;SIGA(X+M)达到 ≥0.90、耗时约 5 分钟,约 36× 提速。
  • 错误类型:缺失块由 6 例降到 3 例;属性取值错误仍有约 11–15 例,需 schema 之外的领域知识。速查表使探索性文件访问减少约 50%。
  • OpenFOAM(30 任务):SIGA 最优组合(R+S)均分 0.870、30/30 全覆盖、0 个零分;对比 Foam-Agent 2.0 均分 0.516、MetaOpenFOAM 0.379。主导组件为 S。
  • LAMMPS(9 任务):DeepSeek 由 4.56 升到 7.78,Claude 由 6.33 升到 6.89(LLM 评分 0–10)。主导组件为 M 与 R。
  • 自演化:SE 留出 TreeSim 0.789,与手选 S+X+M(0.783)相当。
  • 主导机制随接口变化:结构瓶颈(GEOS、OpenFOAM)靠 S;取值正确性瓶颈(LAMMPS)靠 M、R。

与 AutoSim 的关系

SIGA 与 AutoSim 都是用 LLM agent 驱动专业仿真求解器,生成可运行的输入配置。SIGA 的目标是 GEOS 地下多物理场,AutoSim 是 COMSOL 锂电池 P2D。可借鉴之处:把求解器接口知识拆成检索、程序性记忆、轨迹内校验和终止校验四个可开关组件;用 schema 校验和终止门控阻止不完整输出;并发现结构正确性和取值正确性是两类不同瓶颈,需分别对应不同组件。SIGA 的评测停在文件结构相似度(TreeSim),不验证前向预测准确性,这与 AutoSim 强调的留出工况验证不同。

链接

  • 摘要页:https://arxiv.org/abs/2606.09774
  • 本地全文:paper.pdf
32The Power of Small LLMs in Geometry Generation for Physical Simulationssmall-llm-geometry

The Power of Small LLMs in Geometry Generation for Physical Simulations(small-llm-geometry)

  • 来源:arXiv 2503.18178 [cs.CE],2025 年 3 月 23 日提交,24 页,17 图。
  • 作者/机构:Ossama Shafiq、Bahman Ghiassi、Alessio Alexiadis;英国伯明翰大学(依据 bham.ac.uk 邮箱与 BEAR 高性能计算集群推断)。
  • 求解器:GMSH(开源有限元网格生成器,目标输出为 .geo 脚本);面向 COMSOL、ANSYS 等仿真平台的几何输入环节。
  • 类型:小模型微调实验。

做什么

把自然语言描述转成 GMSH 几何脚本。研究目标是用微调后的小语言模型生成精确的工程几何代码。模型为 Phi-3 Mini 和 Qwen-2.5 1.5B,对照大模型 GPT-4o 和中等规模的 Qwen-2.5 14B。任务限定在单体几何,并附带多体几何的测试。

设计思路

用参数高效微调让小模型生成精确的 GMSH 几何脚本。对 Phi-3 Mini 和 Qwen-2.5 1.5B 用 LoRA 微调,对 Qwen-2.5 14B 用 4-bit 量化的 QLoRA。训练数据由 Python 脚本自动生成,共 480 条指令-输出对。每条样本经自动校验:GMSH 语法可执行、几何形状正确、参数一致。微调框架为 LitGPT,硬件为 NVIDIA A100 40GB。

Agent 解决的问题

把自然语言几何描述转成可执行的 GMSH .geo 几何脚本,用于仿真前处理。仿真平台(COMSOL、ANSYS)的几何与网格输入需要手写脚本或图形界面操作,耗时且需要专业经验。该工作让使用者用自然语言描述几何,由模型直接生成 GMSH 几何代码。

标准输入 / 输出

  • 输入:自然语言几何描述,含尺寸、单位和坐标。例如“为边长 10 单位、以原点为中心的方形生成 GMSH 脚本”。尺寸支持整数与浮点,单位支持毫米与厘米,位置支持原点或显式坐标。
  • 输出:GMSH .geo 几何脚本,即生成目标几何的 .geo 文件内容。

能力评价标准

两者。评分既要求 GMSH 语法可执行(规则判定),又对几何形状、尺寸、参数、单位的匹配程度按容差分档打分(拟合误差)。

评分用四项标准,每项 0-15 分,每个几何满分 60 分:

  • 形状准确性(Shape Accuracy):完全匹配 15 分,轻微偏差 10 分,明显改变 5 分,重大偏差 0 分。
  • 尺寸准确性(Dimensional Accuracy):1% 容差内 15 分,5% 容差内 10 分,10% 容差内 5 分,误差超 10% 为 0 分。
  • 参数匹配(Parameter Matching):完全匹配 15 分,轻微差异 10 分,显著差异 5 分,参数错误 0 分。
  • 单位一致(Unit Consistency):完全一致 15 分,轻微不一致 10 分,重大不一致 5 分,完全不一致 0 分。

评测用 7 条提示覆盖方形、矩形、圆、半圆、管道、弯管、工字梁。关键结果:微调后 Phi-3 Mini 在全部 7 类几何均达 60/60;Qwen-2.5 1.5B 在方形、圆、半圆、弯管达 60/60,矩形、管道 50/60,工字梁 30/60;微调后的小模型在单体几何上超过未微调的 GPT-4o(基线 60/60 仅限方形、矩形、圆,弯管 25/60)。Qwen-2.5 14B 微调后在复杂几何上反而不如 1.5B,部分形状较基线下降。多体几何仍失败,原因是训练集只含单体几何样本。

方法

用 LoRA 对小模型做参数高效微调,Qwen-2.5 14B 改用 4-bit 量化的 QLoRA。

训练数据用 Python 脚本自动生成,共 480 条指令-输出对,四类几何各 120 条:基础形状(方形/矩形)、曲线元素(圆/半圆)、结构件(工字梁)、复杂几何(管道/弯管)。每条指令-输出对经过三项校验:GMSH 语法可执行、几何形状正确、参数一致。每类几何用 8 种指令模板,并控制整数/浮点尺寸、毫米/厘米单位、原点/显式坐标的均衡分布。

超参数经系统搜索后选定:LoRA rank=8、alpha=16、训练 3 个 epoch、最小学习率 1.0e-05。框架为 LitGPT,硬件为 NVIDIA A100 40GB。

评分用四项标准(形状准确性、尺寸准确性、参数匹配、单位一致),每项 0-15 分,每个几何满分 60 分。

结果/信号

微调前基线:

  • GPT-4o:方形、矩形、圆为 60/60;半圆 55/60;弯管 25/60。
  • Qwen-2.5 14B:方形/矩形 55/60;管道与工字梁 30/60;圆 10/60。
  • Phi-3 Mini:矩形 40/60;多数其他形状 5/60。
  • Qwen-2.5 1.5B:各几何在 5-15/60 之间。

微调后:

  • Phi-3 Mini:所有几何均达 60/60。
  • Qwen-2.5 1.5B:矩形、圆、弯管 60/60;方形、管道 50/60;工字梁 30/60。
  • Qwen-2.5 14B:方形/矩形 55/60;复杂几何 30/60,部分形状较基线下降。

结论:微调后的小模型在单体几何上超过未微调的大模型。参数更多的 Qwen-2.5 14B 在复杂几何上反而不如 1.5B 模型。局限:单提示内含多个几何时性能下降,会合并指令或漏输出,原因是训练集只含单体几何样本。

与 AutoSim 的关系

机制相邻,但不同领域。该工作处理仿真前处理中的几何/网格输入,把自然语言转成求解器可执行的脚本;AutoSim 驱动 COMSOL 做锂电池 P2D 电化学建模,关注物理接口、反应机理、状态变量与参数识别。两者共同点是用 LLM 生成仿真工具的结构化输入。

可借鉴之处:一是小模型经领域数据微调即可在窄任务上达到高语法合规度,对结构化脚本生成是低成本路径;二是该工作对每条样本做语法可执行与几何正确的自动校验,与 AutoSim 的留出验证、求解后再验证的思路一致;三是其训练集只含单体导致多体失败,提示训练数据分布必须覆盖目标工况,否则模型在分布外拒绝或出错。差异在于该工作仅做几何生成,不涉及反应机理、状态变量耦合与参数识别,也未做前向预测的留出验证。

链接

  • 摘要页:https://arxiv.org/abs/2503.18178
  • PDF:https://arxiv.org/pdf/2503.18178
  • 本地全文:paper.pdf
33Agentic LLMs for Automated Structural Analysis of 3D Frame Systemsstructural-3dframe-agent

Agentic LLMs for Automated Structural Analysis of 3D Frame Systems(短名: structural-3dframe-agent)

  • arXiv/来源: 2606.06525 · HTML 全文 · 学科 cs.GR / cs.AI
  • 作者/机构: Ziheng Geng, Ian Franklin, Santiago Martinez, Jiachen Liu, Yunhe Zhao, Minghui Cheng(机构未在摘要页列出,待确认)
  • 求解器: SAP2000(结构分析软件,框架生成可执行脚本)
  • 类型: agentic LLM 自动化结构分析

做什么

从自然语言描述自动构建并分析 3D 框架结构。把不规则三维几何投影到二维平面,用正交网格线定义坐标,用楼层数矩阵编码竖向拉伸。目标是替代人工有限元建模,该流程耗时且易出错。

设计思路

把已有二维框架方法扩展到三维,难点是不规则几何的无歧义表示、拓扑一致性和更长的推理链。 先用结构化几何表示:三维框架投影到二维平面,正交网格线定义平面坐标,楼层数矩阵(MNS)编码每个网格单元的竖向层数。 在此表示上建多智能体流水线:问题解析得 JSON,楼层分解从 MNS 推导各层平面布局,再由节点、梁、板、柱、支座、荷载智能体逐步装配,几何翻译与代码编译生成 SAP2000 脚本。 用楼层分解作为中间表示,把长程三维推理拆成可控子步。

Agent 解决的问题

把不规则三维框架的建模拆成可控子步,控制长程推理中的幻觉与拓扑错误。 通用大模型直接推理三维拓扑会产生重复节点、缺失构件、连接错误;分层分解加专职装配智能体维持几何与拓扑一致,并生成可导入 SAP2000 的脚本。

标准输入 / 输出

  • 输入:三维框架结构的自然语言问题描述,几何以二维平面网格线加楼层数矩阵(MNS)编码,经问题解析转为结构化 JSON。
  • 输出:可执行 SAP2000 脚本,导入后得到结构模型与分析结果(变形图、轴力、剪力、弯矩图)。

能力评价标准

规则判定题目准确率(accuracy %),正确要求脚本可导入且模型与结果与参考解一致。 10 个三维框架基准问题,重复试验平均准确率 90%。 基线 GPT-5.4 与 Gemini-3.1 Pro 在全部基准上无法生成正确模型,脚本导入成功率 GPT 约 4%、Gemini 约 0.47。 消融:移除楼层分解智能体降到 30-50%,合并几何智能体降到 50-70%,合并翻译阶段完全失败。 论文以题目准确率衡量,未给出内力的连续数值误差。

方法

多智能体流水线。各 agent 分工: 问题解析、楼层分解、节点、梁、板、柱、支座、荷载、几何翻译、代码编译(共 10 个)。流水线先解析问题,再逐层分解几何,组装构件与边界条件、荷载,最后生成 SAP2000 脚本。

结果/信号

  • 10 个 3D 框架基准问题上平均准确率 90%。
  • 单算例约 175 秒,平均成本 0.193 美元。
  • 基线 GPT-5.4(约 158 秒)与 Gemini-3.1 Pro(约 386 秒)在全部基准上无法生成正确模型;原文另给脚本导入成功率 GPT 约 4%、Gemini 约 0.47。
  • 主要失败: 材料属性赋值错误、漏掉指定荷载。
  • 消融: 移除楼层分解 agent 降至 30–50%;合并几何 agent 降至 50–70%;合并翻译阶段完全失败。

与 AutoSim 的关系

机制相邻,与电化学无关。两者都是 LLM agent 驱动外部求解器自动建模: 本文驱动 SAP2000 做结构分析,AutoSim 驱动 COMSOL 做电池 P2D 电化学仿真。可借鉴的点: 把建模拆为多个专职 agent、用结构化几何表示降低歧义、用留出基准评估准确率、对长推理链做消融定位失败环节。结构域无电化学物理接口、反应机理与参数识别,不可直接迁移领域知识。

链接

  • 摘要: https://arxiv.org/abs/2606.06525
  • 全文: https://arxiv.org/html/2606.06525
  • 本目录论文 PDF: paper.pdf
34Automating Structural Analysis Across Multiple Software Platforms Using Large Language Modelsstructural-cross-platform

Automating Structural Analysis Across Multiple Software Platforms Using Large Language Models(短名:结构分析跨平台 LLM)

  • arXiv/来源: arXiv 2604.09866,提交 2026-04-10
  • 作者/机构: Ziheng Geng、Ian Franklin、Minghui Cheng(通讯)等(University of Miami);Jiachen Liu(HBC Engineering);Ran Cao(Hunan University);Dan M. Frangopol(Lehigh University)
  • 求解器: ETABS、SAP2000、OpenSees(结构有限元分析软件)
  • 类型: 多智能体 LLM 系统,自动化结构分析,跨多平台脚本生成

做什么

让 LLM 自动完成框架结构分析,并同时支持三个 FEA 平台。已有研究只针对单一平台。本文目标是用一套系统驱动 ETABS、SAP2000 和 OpenSees,不需为每个软件单独训练。

设计思路

工程实践常按项目需求混用多种 FEA 软件,为每个软件单独训练 LLM 不可扩展。 把任务拆成两个子任务:从用户输入推理出建模所需信息,再把信息翻译为各平台脚本。 对应两阶段多智能体架构:阶段一汇总为与平台无关的统一 JSON,阶段二并行翻译为各平台脚本。 统一中间表示与平台相关翻译解耦,新增平台只需加一个翻译智能体。

Agent 解决的问题

用一套系统跨多个 FEA 平台自动建模,避免逐平台单独训练。 通用大模型难以满足商业软件严格的语法与建模逻辑(脚本常因表名不规范导入失败);本架构以统一表示加平台专用语法提示生成可导入、可跑通的脚本。

标准输入 / 输出

  • 输入:框架结构分析的自然语言描述,经五个推理智能体汇总为与平台无关的统一 JSON,含几何、材料、边界与荷载。
  • 输出:各平台可执行脚本,OpenSees 的 .tcl、SAP2000 的 .s2k、ETABS 的 .e2k,导入后求得变形与内力图。

能力评价标准

规则判定题目准确率(accuracy %),判定门槛为两者结合。 脚本须可导入执行,且生成的内力图与参考解一致才算正确。 20 个框架问题、每问题 10 次试验:OpenSees 98%、SAP2000 100%、ETABS 99%,摘要称所有案例超过 90%。 基线 GPT-5.2 在 OpenSees 18%、商业平台 0%;Gemini-3-Pro 在 OpenSees 79%、商业平台 0%。 论文以题目准确率衡量,未给出内力的连续数值误差。

方法

两阶段多智能体架构。

阶段一:五个智能体协作,从用户描述中推理出几何、材料、边界和荷载信息,汇总为统一的、与平台无关的 JSON 表示。骨干模型 GPT-OSS 120B。

阶段二:多个代码翻译智能体并行运行,把 JSON 转为各平台的可执行脚本(OpenSees 的 .tcl、SAP2000 的 .s2k)。每个智能体被提示对应软件的语法规则和建模流程。ETABS 额外用一个语义映射智能体,把对象表示转为楼层表示。代码生成用 Llama-3.3 70B。

成功判据:脚本可执行无错,且内力图与参考解一致。

结果/信号

  • 20 个代表性框架问题,每问题 10 次独立试验。
  • 摘要明确:所有案例准确率超过 90%。
  • 全文页检索到的分项数字(未逐一核对原文表格):OpenSees 98%、SAP2000 100%、ETABS 99%;每脚本运行 113–144 秒;每问题成本 $0.012–$0.025。
  • 基线对比:GPT-5.2 在 OpenSees 18%、商业平台 0%;Gemini-3-Pro 在 OpenSees 79%、商业平台 0%。

与 AutoSim 的关系

机制相邻,与电化学无关。共同点是用多智能体 LLM 驱动外部数值求解器,把自然语言任务转为求解器可执行脚本,并以求解结果正确性作为验证标准。差异是本文求解结构力学框架问题(ETABS/SAP2000/OpenSees),AutoSim 求解锂电池 P2D 电化学问题(COMSOL)。其"统一中间表示 + 平台相关翻译"和"留出参考解验证"的分工,可作为 AutoSim 架构参考。

链接

  • 摘要页: https://arxiv.org/abs/2604.09866
  • 全文页: https://arxiv.org/html/2604.09866
  • 论文 PDF: paper.pdf
35轻量级 LLM 多智能体二维框架结构分析系统structural-lightweight-2dframe

轻量级 LLM 多智能体二维框架结构分析系统(短名:structural-lightweight-2dframe)

arXiv/来源:arXiv 2510.05414,https://arxiv.org/abs/2510.05414 作者/机构:Ziheng Geng、Jiachen Liu、Ran Cao、Lu Cheng、Haifeng Wang、Minghui Cheng;迈阿密大学、湖南大学、伊利诺伊大学芝加哥分校、华盛顿州立大学 求解器:OpenSeesPy(有限元) 类型:LLM 多智能体,结构工程,二维框架有限元建模

做什么

将二维框架结构分析的有限元建模自动化。系统接收用户描述,提取参数,生成可执行的 OpenSeesPy 代码并完成校验。核心推理引擎用 Llama-3.3 70B Instruct,定位为轻量、低成本部署。

设计思路

由一维梁分析扩展到二维框架,需要空间推理与拓扑一致性,是当前 LLM 的薄弱环节。 将任务拆为五个专职智能体:问题分析、几何、代码翻译、模型校验、荷载。 几何智能体按专家规则逐跨逐层推导节点坐标与单元连接,校验智能体做一致性检查并去重重编号。 关键是把几何推理与代码生成解耦为两个阶段,用轻量开源模型控制成本。

Agent 解决的问题

用轻量开源模型完成需要严格遵守领域规则的框架建模。 通用大模型直接生成框架脚本时几何与拓扑易出错;分阶段推理加独立校验可保证脚本可执行且结构一致,同时降低部署成本。

标准输入 / 输出

  • 输入:二维框架结构的自然语言描述,含几何、边界与材料参数,先提取为结构化 JSON。
  • 输出:可执行 OpenSeesPy(Python)代码,经校验后导入求解,得到结构模型与内力结果。

能力评价标准

规则判定题目准确率(accuracy %)。 基准为 20 个框架问题,10 次重复试验,输出脚本须可执行且模型与参考解一致才算正确。 多数情况准确率超过 80%,三跨框架完全正确,五跨框架平均 88%,复杂不规则拓扑降到 60-70%。 对比 Gemini 2.5 Pro 平均 37%、ChatGPT-4o 全部为 0%。 论文以题目准确率衡量,未给出位移或内力的连续数值误差。

方法

任务拆分为五个智能体:

  • 问题分析智能体:将几何、边界与材料参数提取为结构化 JSON。
  • 几何智能体:按专家规则逐跨、逐层推导节点坐标与单元连接。
  • 代码翻译智能体:将 JSON 转为可执行 OpenSeesPy 代码。
  • 模型校验智能体:用预定义工具做一致性检查,去重并重编号。
  • 荷载智能体:施加荷载条件。

关键设计是将几何推理与代码生成解耦为两个阶段。

结果/信号

  • 基准集 20 个框架问题,10 次重复试验。
  • 多数情况准确率超过 80%。
  • 三跨框架:完全正确。
  • 五跨框架:15 个问题平均准确率 88%。
  • 复杂不规则拓扑:准确率降到 60-70%。
  • 对比:Gemini 2.5 Pro 平均 37%(区间 0-90%);ChatGPT-4o 全部为 0%。
  • 消融:几何与代码合并为单一智能体时准确率为 0%。
  • 运行时间:随复杂度线性增长,3-2-3 框架 269.2 秒,对照人工编码 17 分 24 秒。
  • 成本:每题 \$0.0074-\$0.0228,与 ChatGPT 的 \$0.0104-\$0.0138 相当。

与 AutoSim 的关系

机制相邻,与电化学无关。共同点是用 LLM 多智能体驱动数值求解器,将任务拆分为参数提取、 模型构建、代码生成与校验等环节,并强调用轻量模型控制成本。该工作的求解器是结构有限元 OpenSeesPy,领域为二维框架结构,不涉及锂电池或 P2D 电化学建模。其几何与代码解耦、独立 校验智能体的做法可作为 AutoSim 智能体分工的参照。

链接

  • 摘要页:https://arxiv.org/abs/2510.05414
  • 全文:https://arxiv.org/html/2510.05414
  • 论文 PDF:paper.pdf
36多智能体架构降低结构建模中的大模型幻觉structural-multiagent-hallucination

多智能体架构降低结构建模中的大模型幻觉(短名:结构多智能体抗幻觉)

arXiv/来源:arXiv 2603.07728 — https://arxiv.org/abs/2603.07728 作者/机构:Ziheng Geng、Jiachen Liu、Ran Cao、Lu Cheng、Dan M. Frangopol、Minghui Cheng(机构未在检索页面给出) 求解器:OpenSeesPy(结构有限元) 类型:多智能体 LLM 驱动求解器,结构工程领域

做什么

自动完成二维框架结构的有限元建模。输入为结构问题描述,输出为可执行的 OpenSeesPy 脚本。目标是在多步建模中降低大模型幻觉与误差累积。

设计思路

真实结构建模常需上百到上千步,步数增加会放大幻觉与误差累积。 将工作流拆为四个模块、多个专职智能体:分析与规划、几何装配、载荷集成、代码翻译。 先由问题分析与施工规划智能体提取参数并生成分步装配计划,再让节点与单元智能体并行装配几何,载荷智能体施加节点与构件载荷,最后由代码翻译智能体把结构化数据转为 OpenSeesPy 脚本。 按步骤类型用规则约束各智能体,把长序列建模拆成可控子步。

Agent 解决的问题

降低长序列结构建模中的幻觉与误差累积。 单一 LLM 一次生成长脚本时易产生重复节点、缺失单元等错误;多智能体分步装配并用中间结构化表示隔离代码生成,提高一致性、数值正确性与效率。

标准输入 / 输出

  • 输入:二维框架问题的自然语言描述,含竖向柱与水平梁布局、每跨层数与层高、固定支座、均布荷载与节点点荷载等。
  • 输出:可执行 OpenSeesPy(Python)脚本,导入后得到结构模型与内力结果。

能力评价标准

规则判定题目准确率(accuracy %)。 基准为 20 个代表性框架问题,每个 10 次重复试验。 所提多智能体架构 18 个案例 100%、2 个案例 90%,平均 99%,对比顺序式架构平均 91%。 论文以题目准确率衡量,未给出位移或内力的连续数值误差。

方法

采用四个模块、多个专职智能体:

  • 分析与规划:问题分析智能体提取参数,施工规划智能体生成分步装配计划。
  • 几何装配:节点智能体与单元智能体并行执行,按步骤类型规则约束。
  • 载荷集成:载荷分配智能体把载荷映射到结构构件。
  • 代码翻译:独立智能体把结构化数据转为 OpenSeesPy 脚本。

使用两个骨干模型:GPT-OSS 120B 负责复杂推理,Llama-3.3 70B Instruct Turbo 负责信息映射。

结果/信号

  • 20 个基准框架问题、每个 10 次试验:18 个案例 100% 准确,2 个案例 90% 准确。
  • 与顺序式架构对比:平均准确率 99% 对 91%。
  • 运行时间:75.4–194.2 秒,对比顺序式 269.2–949.0 秒。
  • 大规模案例(7 跨与 10 跨框架):准确率 90%、100%、80%。
  • 成本:每个问题 $0.013–$0.023。

与 AutoSim 的关系

机制相邻,与电化学无关。该工作用专职智能体并行装配(节点/单元/载荷)并把结构化中间表示翻译为求解器脚本,与 AutoSim 用智能体驱动 COMSOL 生成 P2D 模型的"分步建模 + 代码生成 + 降低幻觉"思路相通。可借鉴:按步骤类型约束智能体、并行装配、用中间结构化表示隔离求解器代码生成。其领域为结构有限元,不涉及电化学物理接口、反应机理或参数识别。

链接

  • 摘要页:https://arxiv.org/abs/2603.07728
  • 全文(HTML):https://arxiv.org/html/2603.07728
  • 论文 PDF:paper.pdf
37Integrating Large Language Models for Automated Structural Analysisstructural-openseespy-text2script

Integrating Large Language Models for Automated Structural Analysis(短名:Structural-OpenSeesPy-Text2Script)

  • arXiv/来源:arXiv 2504.09754(https://arxiv.org/abs/2504.09754)
  • 作者/机构:Haoran Liang、Mohammad Talebi Kalaleh、Qipei Mei,加拿大阿尔伯塔大学土木与环境工程系
  • 求解器:OpenSeesPy(2D 框架有限元分析)
  • 类型:LLM 文本到求解脚本生成 + 基准测试

做什么

将结构分析的文字描述自动转成可执行的 OpenSeesPy 脚本。 LLM 解析文本描述,生成 Python 脚本并调用有限元工具,完成从描述到结果的全自动分析。 作者构建了 20 道结构分析文字题作为基准。

设计思路

把"自然语言描述到求解脚本"拆成三层。 数据层用 SQLite 存放用户需求与系统指令,系统指令含问题描述、Python 代码模板和指令调优元素。 模型层让 LLM 调用 OpenSeesPy,代码生成分三阶段:参数提取、结构布局与边界荷载、可视化,分三次调用 API 以缩短单次生成长度。 输出层产出分析报告与内力表格。 用领域专用提示和上下文学习提升求解稳定性。

Agent 解决的问题

替代人工编写有限元脚本和调试。 工程师只需给出自然语言问题,系统自动提取参数、生成并执行 OpenSeesPy 脚本,输出分析结果。 分三步生成代码以降低长代码一次生成带来的错误,并便于定位失败段。

标准输入 / 输出

  • 输入:结构分析文字题,描述框架几何、构件、支座与荷载(如"两根竖向柱、一根水平梁,左柱顶施加水平点荷载 2e3 N"),外加系统指令。
  • 输出:可执行 OpenSeesPy(Python)脚本,以及分析结果,包括变形图、轴力图、剪力图、弯矩图和内力表格。

能力评价标准

规则判定题目准确率(accuracy %)。 将模型输出与人工标注标准答案比较,正确即计分。 GPT-4o best-of-3 达 100%,GPT-4 85%,Gemini 1.5 Pro 80%,Llama-3.3 30%。 论文未明确给出位移或内力的连续数值误差,仅以题目准确率衡量。

方法

框架分三层。 数据层用 SQLite 存储用户需求和系统指令。 模型层用 OpenSeesPy 做 2D 框架分析,代码生成分三步:参数提取、结构布局定义、可视化。 输出层产出结构化报告、代码说明和内力表格。 采用领域专用提示和上下文学习。

结果/信号

基准为 20 道人工设计的结构分析文字题,附标准答案。

模型对比(best-of-3 采样): - GPT-4o:100% - GPT-4:85% - Gemini 1.5 Pro:80% - Llama-3.3:30%

稳定性测试(GPT-4o,每题 5 次): - 9/20 题达 100% - 8/20 题为 60-80% - 3/20 题为 40%

领域指令影响: - 例 12 无指令 50%,加完整指令后 80% - 第 20 题加分布荷载指令后,Gemini 与 GPT-4o 均升至 100% - 领域指令使非对称结构性能提升 30%

与 AutoSim 的关系

机制相邻,与电化学无关。 两者都是 LLM 驱动外部求解器:本文驱动 OpenSeesPy 做结构有限元,AutoSim 驱动 COMSOL 做电池 P2D 电化学仿真。 共性是把自然语言任务翻译成可执行的求解脚本,并用基准题验证准确性。 差异在领域:本文为结构静力分析,不涉及反应机理、状态变量或参数识别。

链接

  • arXiv 摘要:https://arxiv.org/abs/2504.09754
  • HTML 全文:https://arxiv.org/html/2504.09754
  • 论文 PDF:paper.pdf
38VFEAgent:端到端自动化有限元分析的多模态智能体框架vfeagent

VFEAgent:端到端自动化有限元分析的多模态智能体框架(VFEAgent)

  • arXiv/来源:arXiv 2605.28978。HTML 全文可访问。
  • 作者/机构:Jiachen Zhang、Junyi Lao、Chenghao Liu、Siyuan Liu、Shixin Wu、Linsen Zhang、Boyu Wang、Songfang Huang(通讯)。机构为北京大学与中国农业大学。
  • 求解器:Abaqus(Simulia 2022),通过其 Python 脚本接口驱动。
  • 类型:多模态视觉语言多智能体框架,面向有限元分析(FEA)建模与求解。

做什么

从图像和文本问题描述直接生成完整的有限元仿真。输入是原始工程图纸与文字说明。系统读取图纸,推断几何、材料、边界条件和载荷,并生成可执行的 Abaqus Python 脚本。论文针对三个已有问题:模板式伪建模、忽略原始工程图、调试机制只处理表层语法错误。

设计思路

把端到端 FEA 建模形式化为映射 X=(I, T_ctx) → R,I 为结构图,T_ctx 为材料性质与载荷文本。将该映射拆为两步:先经感知 φ_perc 得到与求解器无关的中间表示 Y=(几何, 材料, 边界条件, 载荷),再经综合 φ_syn 生成可执行脚本 S,最后求解得 R。中间表示 Y 受严格 JSON 模式约束,保证物理有效与求解器无关。核心新意有两点:感知阶段直接把原始工程图喂给视觉语言模型做端到端推理,不经 Canny 边缘检测或网格叠加等预处理;综合阶段在执行前做基于抽象语法树(AST)的静态预检,并用经验回放与确定性回退构成神经符号交接。

Agent 解决的问题

把工程图纸自动转成可执行的 Abaqus Python 脚本并跑出结果。具体解决:从栅格图纸提取几何拓扑、材料、边界条件与载荷;区分图中"尺寸标注线"与"结构梁"等视觉歧义;在执行前拦截生命周期缺失(如漏掉 job.submit())和不安全 API 调用;运行报错时基于历史错误模式自纠正重试。

标准输入 / 输出

标准输入:原始工程图纸(栅格图像 I)加文本说明(材料性质、载荷大小,T_ctx)。 中间输出:与求解器无关的中间表示 Y,受 JSON 模式约束,含几何拓扑(节点与连接 V、E)、材料分区、边界条件与载荷向量。 标准输出:可执行的 Abaqus Python 脚本 S,以及沙箱执行后的产物(ODB 结果库、JSON、运行日志、性能指标)。

能力评价标准

规则判定为主,不与真值做拟合误差。感知阶段(Stage-A)指标:模式有效性 Schema Validity(VFEAgent 90.0%)、节点检测准确率 Node Acc(81.5%)、连接关系 Conn F1(64.8%)、边界条件检测 BC Det(60.0%)、整体感知得分(70.4%)。执行阶段(Stage-B)指标:执行成功率 Execution Success Rate(定义为生成脚本成功跑完整个 Abaqus 作业并产出可读 ODB 的比例,100%)、预检安全合规、生命周期完整性。这些都是规则判定脚本是否合法、是否可执行、是否跑通,未涉及与参考解的相对误差或前向预测准确性考核。

方法

系统分两个阶段。

第一阶段为感知(FEM_VLM_MAS)。采用 ReAct 驱动的多智能体,包含感知智能体(OCR 与几何检测)、推理智能体(拓扑推断)、验证智能体(模式审计)和编排智能体(全局规划)。输出与求解器无关的中间表示(IR),包含几何、材料、边界条件和载荷。验证分四级:模式完整性、物理稳定性、工程合理性、视觉一致性。

第二阶段为综合(Text2Abaqus)。采用先验证后生成的代码合成与反思式调试。包含基于 AST 的预检(生命周期完整性与 API 安全约束)、沙箱执行与产物隔离、存储历史错误模式的经验回放缓冲、以及确定性回退模板。神经重试预算 K<=3 用尽后切换到回退模板。

多模态输入为原始工程图纸(栅格图像)加文本说明,直接从图纸推理,不经中间计算机视觉预处理。

结果/信号

基准为专家整理的 15 个复杂工程场景,包括非对称钢框架、梁拓扑优化、压力容器、超材料。评价指标含 Mises 应力、模态频率、加速度、应变能。

第一阶段(结构解释):模式有效性 90.0%(Gemini-3-Pro 为 41.7%),节点检测准确率 81.5%,连接关系 F1 为 64.8%,整体感知得分 70.4%。

第二阶段(执行鲁棒性):执行成功率 100%,预检安全合规 1.00,生命周期完整性 1.0,物理约束合规 1.00。

基线失败分类:生命周期盲区占 45%,API 幻觉占 30%,不安全状态操作占 25%。基线为 GPT-4o、GPT-5(Preview)、Gemini-3-Pro、Qwen-3-Max,使用思维链提示。确定性回退在全部基准中未被触发(激活率 0%)。

与 AutoSim 的关系

AutoSim 驱动 COMSOL 完成锂电池 P2D 电化学建模。VFEAgent 驱动 Abaqus 完成结构有限元分析。两者在以下维度相关。

多模态输入:VFEAgent 从工程图纸读取几何与参数,AutoSim 主要从文本和实验数据出发;该工作给出从图像提取结构化建模规格的参考路径。

先验证后生成:VFEAgent 在执行前用 AST 预检查代码的生命周期与 API 安全,与 AutoSim 在生成 COMSOL 脚本前检查物理接口、反应机理与状态变量是否足以表达目标现象的思路一致。

自调试:VFEAgent 用经验回放缓冲与反思式调试构成闭环,对应 AutoSim 每轮基于验证证据只改一个建模假设再重新求解的循环。

差异:VFEAgent 用执行成功率与模式有效性衡量正确性,不涉及对前向预测准确性和留出工况验证的考核。AutoSim 需要参数被训练数据约束并经留出验证,无法识别时给边界或拒绝输出;这一层 VFEAgent 未覆盖。

链接

  • 摘要页:https://arxiv.org/abs/2605.28978
  • HTML 全文:https://arxiv.org/html/2605.28978
  • 备用:https://ar5iv.org/html/2605.28978
  • 本地全文:paper.pdf
清屿科技 TSINGYUAI2026受限公开