融合动力

故障诊断与容错控制咨询概述


故障诊断:指通过监测系统运行状态,实时检测、分离和辨识发生的异常(故障),一般包含三个层次:

故障检测:判断系统是否发生了故障;

故障隔离:定位故障发生的具体部件或子系统;

故障辨识:确定故障的类型、大小、时变特性等。

有时也统称为 FDI(Fault Detection and Isolation)或 FDD(Fault Detection and Diagnosis)。

容错控制:指系统在发生故障后,通过在线调整控制策略,使系统仍能保持稳定,并在性能适当降低的前提下继续运行,避免故障演变为事故。可分为两类:

被动容错控制:在设计阶段就考虑预设的故障集合,依靠鲁棒控制器使系统对这些故障不敏感;

主动容错控制:在线利用故障诊断信息,实时重构或重调度控制器,主动应对实际发生的故障。

两者关系:故障诊断是“感知”,负责发现和定位问题;容错控制是“行动”,基于诊断结果进行控制干预。真正有效的容错控制通常依赖快速、准确的故障诊断。

(1)提高安全性

在航空航天、核电、化工等高危场景中,故障若不能及时处理可能造成灾难性后果。诊断与容错机制能在危险发生前干预,保护人员和环境。

(2)提升可靠性与可用性

即使部分元件失效,系统仍能维持运行(可能降级),避免非计划停机,提高设备利用率。

(3)降低维护成本

从“定时维修”转向“视情维修”或“预测性维护”,根据实际健康状态制定维护计划,减少不必要的拆检和备件消耗。

(4)保护设备/延长寿命

故障初期即被抑制,避免小异常发展成严重损坏,从而延长系统整体寿命。

(5)保障生产效率与质量

在工业过程中,故障可能导致产品批次报废。通过容错控制维持工艺参数,可减少废品,保住产能。

从学科和工程角度看,主要包括以下模块:

(1)故障建模与分类

按位置:传感器故障、执行器故障、元部件/过程故障;

按时变特性:突变故障、缓变故障、间歇故障;

按建模形式:加性故障、乘性故障等。

(2)故障检测与诊断方法

基于解析模型的方法:观测器/滤波器(Luenberger观测器、卡尔曼滤波器、未知输入观测器)、参数估计、等价空间法等。

基于信号处理的方法:频谱分析、小波变换、经验模态分解、主成分分析(PCA)、偏最小二乘(PLS)等。

基于知识/数据驱动的方法:神经网络、深度学习、支持向量机、模糊逻辑、专家系统等,适用于难以精确建模的复杂系统。

决策逻辑:残差评价、阈值设定、假设检验、混淆矩阵评价等,平衡故障检测率与误报率。

(3)容错控制设计

被动容错:可靠镇定、完整性设计、同时镇定、鲁棒H∞控制等。

主动容错:控制律重构(伪逆法、模型跟随)、多模型切换/加权、预测控制(MPC)重构、控制分配重构等。

过渡管理:无扰动切换、防积分饱和、安全状态转移等。

(4)集成设计与评估

诊断与控制协同设计,避免相互干扰;

可诊断性与可重构性分析;

故障覆盖率、反应时间、性能降级程度等指标评估;

与健康管理(PHM)系统集成,形成“诊断-预测-容错-维修”闭环。

对于一个实际系统,我公司故障诊断与容错控制专家,将按以下工程化流程推进工作,并在整个过程中,遵循以下原则:安全始终是最高原则,诊断宁可偏保守(防止漏报),容错动作需留足够稳定裕度。

4.1   系统理解与信息收集

(1)吃透工艺/原理:如化工反应器、飞行控制律、电力变换器拓扑等。

(2)梳理关键部件与信号:明确传感器、执行器、控制器、关键物理变量。

(3)收集历史数据与设计文档:正常运行数据、故障案例、维护记录、P&ID图、数学模型等。

4.2   故障模式与影响分析(FMEA/FMECA)

(1)系统罗列所有可能的故障模式(传感器偏差、漂移、执行器卡死、泄漏、短路等)。

(2)评估每种故障的严重度、发生频度和可检测性(风险优先数RPN)。

(3)确定高风险、必须进行诊断与容错设计的关键故障集。

4.3   可诊断性与可重构性分析

(1)判断哪些故障在理论上可检测、可隔离(考虑传感器配置、系统可观性)。

(2)分析硬件冗余(备用泵、多传感器)和解析冗余(通过模型和其他变量推断)。

(3)评估:执行器/传感器发生故障后,系统是否仍具备足够的控制自由度,能否通过重构恢复可控性。

4.4   诊断系统设计

(1)选择方法

有较精确数学模型 → 优先采用基于模型的残差生成器(如卡尔曼滤波组、未知输入观测器),因为可解释性强且对已知故障敏感。

建模困难但数据丰富 → 采用数据驱动方法(深度学习、PCA等)或信号分析。

(2)生成残差与特征:设计一套能够反映故障的残差信号,对扰动和解耦建模误差具有鲁棒性。

(3)决策机制:设定自适应阈值(避免误报),结合趋势分析、持续时间确认等,确保漏报率与误报率的工程可接受平衡。

(4)关键点:诊断速度必须满足容错控制的实时性要求(通常是毫秒到秒级)。

4.5   容错控制策略设计

(1)被动层:即使没有诊断结果,基础控制器也须具备一定鲁棒性,能容忍小的参数摄动和短暂异常。

(2)主动容错层:

传感器故障:切换至解析冗余(软测量)或备用传感器,相应调整控制律的反馈通路。

执行器故障:进行控制重新分配(如飞行控制中的舵面重构),或切换到备用执行器,同时避免指令饱和。

系统级故障:切换预设计的多组控制器(如从正常模式切至“跛行回家”模式),或在线求解新的控制器参数(如采用MPC重构)。

(3)无扰动切换:设计平滑过渡逻辑,避免切换瞬间产生冲击或失稳。

4.6   集成仿真与硬件在环验证

(1)建立高保真仿真模型,注入各类关键故障,逐步测试:

故障检测时间、隔离准确率;

容错后系统的暂态响应与稳态性能;

对未建模动态和噪声的鲁棒性;

多重故障叠加等极端场景。

(2)通过软件在环、硬件在环平台直至现场试投运,逐步放行。

4.7   在线部署与持续进化

(1)将诊断与容错算法部署至实际控制器或上位监控系统。

(2)实时监控误报/漏报情况,收集新故障样本,在线或离线更新模型(如神经网络增量学习)。

(3)与维护系统联动,根据故障严重程度给出预警、降级、紧急停机等分级响应建议。

只要系统复杂度高、失效后果严重、且不允许随时停机的场合,就必然需要故障诊断与容错控制技术的支撑,它已渗透到几乎所有对安全性和可靠性要求高的工业与科技领域:

(1)航空航天:飞行控制系统、发动机健康管理、卫星姿态轨道控制。例如,飞机的电传飞控系统采用了多重冗余和容错控制技术,即使一个或多个传感器或执行器发生故障,飞机仍然能够安全飞行。

(2)汽车与自动驾驶:线控制动/转向、动力电池管理、传感器融合容错。例如,现代汽车的 ABS (防抱死制动系统)、ESP (电子稳定程序) 等都是容错控制技术的应用。

(3)工业过程:石化、炼钢、制药中的反应器、精馏塔、旋转机械等。

(4)电力与能源:电网稳定控制、风电/光伏逆变器、核电站关键回路。例如,风力发电机组在复杂的风况下运行,容易发生故障,故障诊断与容错控制技术可以提高其可靠性和发电效率;核电站的控制系统必须具备高度的容错能力,以确保在任何情况下都能够安全停堆。

(5)轨道交通:列车自动控制系统、牵引系统、制动系统。

(6)船舶与海洋工程:动力定位、推进系统、深海平台。

(7)机器人与智能制造:协作机械臂碰撞后容错、多关节失效重构。例如,工业机器人在执行任务时,如果某个关节发生故障,容错控制可以使机器人利用剩余的关节继续完成任务。

(8)医疗设备:手术机器人、生命支持系统。例如,心脏起搏器必须具备高度的可靠性和容错能力,以确保患者的生命安全。

(9)楼宇与基础设施:暖通空调、供水系统、电梯。

(10)国防领域:武器系统、军事装备、指挥控制系统等。例如,导弹的制导系统必须具备容错能力,以确保在受到干扰或发生故障时仍然能够准确命中目标。





不到底限非好汉