RESEARCH FOCUS
研究主线
从底层算力、研发工具链,到可观测性、安全和自动化,建立能够长期演进的企业 IT 能力。
研发基础设施与 AI Infra
面向 EDA、HPC、AI 训练与推理工作负载,研究算力、存储、调度与研发环境的标准化交付。
EDAHPC / LSFAI Infra
效能、稳定性与 AI Ops
以可观测数据驱动性能优化、容量治理与运维自动化,将故障处置从被动响应转向主动预防。
Linux 性能Zabbix自动化
安全、合规与业务韧性
将身份、网络、终端、应用与数据保护串为闭环,兼顾风险控制、可审计性和业务连续性。
IAMDevSecOps容灾备份
OPERATIONS SOLUTIONS
具体运维方案
以“现状诊断—架构设计—自动化实施—持续运营”为主线,可按企业规模和现有技术栈组合落地。
HPC / EDA 调度与资源治理
梳理队列、许可证、作业资源和排队策略;建立异常作业识别、容量趋势与关键资源的治理机制。
交付:资源基线、调优建议、异常作业规则与报表监控告警与运维自动化
将主机、应用、作业与业务指标接入统一可观测平台;通过分级告警、自动化执行和闭环复盘降低响应成本。
交付:监控矩阵、告警分级、自动化流程与运行手册Linux 性能与云成本优化
围绕 CPU、内存、I/O、网络和实例规格建立性能基线,结合容量与使用率分析,清理闲置与低效资源。
交付:性能评估、容量模型、成本优化清单身份、终端与网络准入
通过 AD、CA 证书、802.1X、最小权限与终端策略,建立可信身份、可信设备和可信网络的接入边界。
交付:准入架构、策略矩阵、实施步骤与验证清单备份容灾与应急响应
明确关键业务恢复目标、备份分层、演练机制和应急角色;把恢复能力从“有备份”提升为“可恢复”。
交付:RTO/RPO 分级、恢复流程、演练与复盘模板中小企业 IT 托管与标准化
将账号、终端、网络、协作系统、资产和服务台纳入统一台账与标准流程,降低日常运维的不确定性。
交付:资产台账、服务目录、巡检表和月度运营报告PROJECT NOTES
研究与学习沉淀
来自真实问题的技术笔记、架构思考与实践复盘,持续更新。
WORKING METHOD
从问题到持续运营
每一项方案都以可验证的目标、明确的边界和可持续的运营机制为前提。
诊断与基线
澄清目标、约束、风险与现状数据,识别优先级。
架构与方案
设计目标架构、实施路径、验收指标和回退方案。
自动化实施
通过标准化、脚本化和文档化降低变更风险。
运营与优化
基于监控、复盘和容量数据持续迭代能力模型。
