首页 > 最新动态 > 机理合规审计与内生安全加固:全球首个可验证大模型机理审计平台|CNCC Tutorial
最新动态
机理合规审计与内生安全加固:全球首个可验证大模型机理审计平台|CNCC Tutorial
2026-10-0511



CNCC2026将于10月21—24日在成都举办。今年将继续推出Tutorial,本篇介绍的Tutorial是——机理合规审计与内生安全加固:全球首个可验证大模型机理审计平台




Tutorial是由领域内专家主讲,面向全体参会者开放的专题讲座或教学环节,旨在介绍研究领域的最新进展或基础知识,内容涵盖原理、挑战、方法等。可以帮助刚进入该方向的博士生、青年学者快速补齐知识短板,以便更好地参会后续的前沿报告理解与未来方向思辨。


今年Tutorial共设置11大主题板块:AI基础模型、机器学习理论与机理、强化学习与推理、视觉多模态与世界模型、AI安全与治理、数据科学与数据空间、机器人与具身智能、Agent智能体、新型计算与网络架构、AI4Science、AI+行业。

(扫码报名)

??Tutorial名称:机理合规审计与内生安全加固:全球首个可验证大模型机理审计平台

??所属主题:AI安全与治理

??日程安排:半天(240分钟),具体时间以官网信息为准

注:如有变动,请以官网(https://ccf.org.cn/CNCC2026)最终信息为准


模块

时长

内容

1. 大模型可信治理的困境与内生机理研究的时代价值

20min

1. 大模型高风险场景落地的安全合规刚需

2. 外部约束式治理的本质局限与内生安全的核心价值

3. 神经网络可解释性领域的发展脉络与现存瓶颈

2. 核心理论:等效交互的数理基础与稀疏性证明

20min

1. 等效交互理论简介

2. 等效交互的严谨数理定义与语义边界

3. 神经网络决策逻辑的稀疏交互解构证明

4. 交互机理的提取方法与验证体系

3. 场景一:大模型机理形式化审计方法与风险实证

25min

1. 大模型决策机理的形式化审计完整方案

2. 开源大模型内嵌逻辑谬误与风险机理的实证发现

3. 法律等垂类场景的机理审计落地案例

4. 本质规律:模型泛化能力的机理解析与第一性表征

30min

1. 可泛化机理与不可泛化机理的二元拆解

2. 两类机理的解析分布规律与实证验证

3. 前沿大模型交互机理表征趋同现象的实证分析

4. 交互机理作为模型特性第一性表征的核心结论

5. 场景二:机理对齐训练范式与内生安全加固

30min

1. 传统输出监督训练的效率瓶颈与安全隐患

2. 机理对齐训练的核心范式与实现路径

3. 训练效率提升与内生安全加固的实验验证

4. 机理对齐在大模型迭代中的应用前景

中场休息

10min

 

6. 应用实践一:深度模型表征缺陷定位

30min

1. 深度模型表征瓶颈的交互视角解析

2. 基于泰勒交互框架的归因方法体系统一

7. 应用实践二:深度模型表征定向修复

30min

1. 模型缺陷的根因定位与定向修复方法

2. 可解释性赋能模型性能优化的实践路径

8. 大模型智能体的安全评估

30min

1. 大模型智能体安全评估

2. AgentDoG 诊断防护框架

开放答疑

15min

现场答疑与交流


Tutorial简介

本Tutorial以大模型的机理合规审计与内生安全加固为主线:基础理论部分系统讲解等效交互机理解释理论,证明神经网络的复杂决策逻辑可被精准解构为稀疏化的交互机理单元;主体内容聚焦大模型决策机理形式化审计、开源模型内嵌风险机理实证、模型泛化能力的二元机理解构与第一性表征,以及机理对齐训练范式在训练效率提升与内生安全加固中的核心应用;课程还将结合法律等垂类场景,深度剖析大模型潜藏的隐性伦理风险与安全隐患,并进一步延伸至可信大模型机理研究的发展逻辑与未来技术演进方向。


Tutorial目标

参与者将能够:

厘清大模型内生安全的核心瓶颈

把握传统可解释性技术的本质局限,理解 AI 安全治理从“外部约束”走向“内生机理”的必然趋势。

掌握等效交互机理解释理论的核心数理框架

理解神经网络复杂决策逻辑可解构为稀疏交互单元的底层原理。

熟悉大模型机理形式化审计的完整技术流程

具备识别模型内嵌风险机理的基础能力。

理解模型泛化能力的二元机理解构

掌握交互机理作为前沿模型特性第一性表征的核心结论。

把握机理对齐训练的核心范式

了解其在提升训练效率、加固内生安全方面的实践路径。

建立“解释—诊断—修复”的完整认知

掌握基于交互机理的模型缺陷定位与定向修复方法,能够将相关技术落地于模型性能优化场景。


讲者介绍




张拳石



上海交通大学电院计算机学院长聘副教授

上海交通大学电院计算机学院长聘副教授,博士生导师,入选国家级海外高层次人才引进计划,获ACM China新星奖。他于2014年获得日本东京大学博士学位,于2014-2018年在加州大学洛杉矶分校(UCLA)从事博士后研究。张拳石在神经网络可解释性方向取得了多项具有国际影响力的创新性成果。张拳石承担了TMLR的责任编辑,CCF-A类会议NeurIPS 2024-2026,ICML 2026的领域主席,IJCAI 2020和IJCAI 2021的可解释性方向的Tutorial,并先后担任了AAAI 2019, CVPR 2019, ICML 2021大会可解释性方向的分论坛主席。

邓辉琦



西安交通大学助理教授

西安交通大学助理教授,入选西交青年优秀人才序列,入选陕西省“三秦英才”人才引进计划。博士毕业于中山大学,博士期间曾在香港浸会大学和美国德州农工大学访问学习3年,曾任上海交通大学计算机系博士后研究员,入选“上海市超级博士后”计划。主要研究方向为可解释、可信人工智能以及人工智能安全。以第一作者/共同一作在TPAMI、ICLR、ICML、NeuRIPS、AAAI、KDD、Pattern Recognition等国际顶级会议和期刊上发表论文多篇,代表性工作受邀机器学习顶级会议ICLR口头报告(Oral presentation, top 1.6%)以及IJCAI 2021 Tutorial报告。获全国博士后创新创业大赛优胜奖。担任TPAMI、TIP、NeuRIPS、ICLR、AAAI、CVPR等顶级刊物的审稿人。

刘东瑞



上海人工智能实验室可信安全中心青年科学家

上海人工智能实验室可信安全中心青年科学家,入选上海市高层次人才计划,担任2030人工智能重大专项课题负责人。长期从事安全可信人工智能研究,包括大模型/智能体的安全高效推理、可解释性、攻防、对齐和评测等。负责国际首个诊断式智能体守卫模型AgentDoG研发,SafeWork-R1攻防和安全高效推理后训练,模型安全水平相对超过 Claude Opus 4和GPT 4.1 5%以上。负责国内首个针对AI灾难性风险技术评测(SafeWork-F1&1.5),获得Anthropic 联合创始人长篇解读。在安全可信领域产出四十多篇高水平会议和期刊论文,包括CVPR 2024 最佳论文候选奖, ACL 2025杰出论文奖, CVPR Oral, ICLR Oral, AAAI Oral和多篇ACL Oral等。



欢迎参加CNCC2026

CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。




图片


图片


点击“阅读原文”,加入CCF。

点我访问原文链接