CNCC2026将于10月21-24日在成都举办。今年将继续推出Tutorial,本篇介绍的Tutorial是——人工智能驱动的社会科学:大模型高通量计算框架与教育大数据实践
Tutorial是由领域内专家主讲,面向全体参会者开放的专题讲座或教学环节,旨在介绍研究领域的最新进展或基础知识,内容涵盖原理、挑战、方法等。可以帮助刚进入该方向的博士生、青年学者快速补齐知识短板,以便更好地参会后续的前沿报告理解与未来方向思辨。
今年Tutorial共设置11大主题板块:AI基础模型、机器学习理论与机理、强化学习与推理、视觉多模态与世界模型、AI安全与治理、数据科学与数据空间、机器人与具身智能、Agent智能体、新型计算与网络架构、AI4Science、AI+行业。
(扫码报名)
模块 | 时长 | 内容 |
0. 开场与导引 | 10min | 讲师与团队介绍、培训资料与代码下载说明(Docker安装包与离线文件、RateMyProfessors 示例数据、README 与参考文献);点明核心痛点与卖点:大模型时代如何在一张消费级显卡上将推理吞吐从约 0.38 token/s 提升至近 16000 token/s。 |
1. 道德和情绪计算的重要性 | 25min | 社会直觉主义模型与道德基础理论(关爱/伤害、公正/欺骗、忠诚/背叛、权威/颠覆、纯洁/堕落);道德—情绪信息为何“可测量、可标注、可计算”;在舆情、教育评价、师德师风与AI价值对齐中的意义;道德识别计算语言学的过去、现在与未来。 |
2. 传统自然语言处理技术(BoW 算法) | 30min | 词袋方法原理;基于eMFD、cMFD(中文)、eduMFD的词典法与GoEmotions 细粒度情绪词袋;eMFD(依赖spaCy)的安装、线下依赖配置与评分参数(DICT_TYPE/PROB_MAP/SCORE_METHOD);词典法的高可解释性与局限。 |
3. 日常的 LLM 使用方法 | 30min | LM Studio 下载、安装与本地模型加载(mistral-7b-instruct);非一致性输出问题与标准化 JSON 模板(System Prompt + Prompt Template);用Python调用本地 API(localhost:1234)批量分析;瓶颈剖析:CPU+网络通讯仅约0.38 token/s。 |
4. 基于 Docker 与 GPU 的部署与效率优势 | 45min | 传统虚拟环境vs Docker容器化方案对比(兼容性、依赖固化、可分享迁移);WSL2 + Ubuntu + Docker Desktop安装流程;vLLM 镜像拉取与模型权重下载;docker run启动本地LLM API服务与调用函数;vLLM/PagedAttention高通量原理——单卡 RTX 4060 实现约 15986 token/s,面向工业部署与教学复用。 |
5. 应用示范:RateMyProfessors + 道德基础理论的教学评估研究 | 30min | 大规模教学评价数据介绍;MoralStrength/eMFD 道德得分计算;关键发现:学生提及关怀的时间变迁(1999—2026)、道德因子对评分的回归影响(Care.virtue r = .19、Cohen’s d = 0.39 接近 Hattie 临界点)、XGBoost+SHAP 标签重要性(关心第2、尊重第5)、词典在教育场景的优化需求;面向教师的可操作建议。 |
6. 总结与 Q&A | 10min | 核心结论:“关怀”是连接教学行为与教学评价的关键纽带;道德情绪计算在教育评价与 AI 价值对齐中的前景;互动答疑与合作交流。 |
Tutorial简介
本课程属于人工智能、心理学与计算社会科学的交叉方向,聚焦大语言模型如何推动社会科学研究从传统的小样本测量、人工编码与静态统计分析,转向可扩展的自然语言分析与高通量计算。课程以“AI for Social Sciences”为总体框架,讨论大语言模型在社会科学研究中的方法价值、文本处理路径与系统实现,并以道德与情绪计算及教育评价作为贯穿课程的代表性案例分享如何使用大语言模型完成社会科学研究,以及如何提高教学评估。
在传统社会科学研究中,个体的心理、态度、价值观和社会行为通常通过量表问卷、实验任务、访谈以及人工内容分析进行测量。这些方法具有明确的理论基础,但也受到样本规模、人工成本、测量形式和生态效度等限制。大语言模型的发展为社会科学提供了新的研究可能:一方面,大模型可以被用于构建具有特定角色、知识和价值倾向的社会代理人,辅助研究个体判断、群体互动和社会规范;另一方面,大模型也可以作为一种生成式文本分析与辅助测量工具,对开放式问卷、评价文本、访谈材料和其他自然语言数据进行编码。由此,大语言模型不再只是通用文本生成工具,而是逐渐成为连接社会科学问题与大规模自然语言数据的新型计算工具。
在理论框架上,课程以道德与情绪计算作为代表性案例,引入Haidt的社会直觉主义模型和Graham、Haidt等人的道德基础理论,说明社会科学理论如何为文本分析提供概念体系和标签依据。在此基础上,课程介绍吴胜涛等人编制的中文版道德基础词典(cMFD,Chinese Moral Foundations Dictionary)以及教育领域的道德基础理论词典(eduMFD, educational Moral Foundations Dictionary)。cMFD将关爱/伤害、公平/欺骗、忠诚/背叛、权威/反抗和圣洁/肮脏等道德基础转化为相应的中文词汇类别,在本课程中主要作为理论驱动词典方法的代表,用于说明传统文本计算如何依据预先定义的理论类别识别道德表达。
在方法与工具上,课程系统比较道德与情绪计算的三类技术范式。第一类是基于cMFD、eMFD等词典资源的理论驱动符号测量方法,通过预定义词汇类别和匹配规则对文本进行快速计分,具有理论来源清晰、计算速度快和结果容易解释等优势,但难以处理否定、隐喻、反讽和词语在不同语境中的意义变化。第二类是基于GoEmotions等标注数据以及RoBERTa、MoralBERT等预训练模型的监督表征学习方法,通过人工标注数据学习文本与情绪或道德标签之间的映射,能够利用上下文信息提高识别能力,但需要高质量训练数据和额外的模型训练。第三类是基于生成式大语言模型的指令驱动文本编码方法,通过零样本或少样本Prompt直接完成文本分类、评分与解释,具有任务定义灵活、迁移成本较低和能够处理复杂语境等特点,但也面临输出波动、格式不一致、计算成本较高和大规模推理效率不足等问题。
针对研究者大规模文本标注时“逐条提问、推理缓慢、环境难以复现”的痛点,课程提供基于Docker、GPU与vLLM的可复现部署方案:借助容器化环境与PagedAttention高通量推理,参与者可在单张消费级GPU上将推理吞吐从普通本地调用的约0.38 token/秒提升至接近16000 token/秒,使原本需数百日的大规模标注任务压缩至小时级,真正实现“工业部署与教学复用”的双重目标,并完整掌握本地大模型部署、标准化Prompt设计、JSON结构化输出与批量文本分析的工具链。
在实践案例上,课程以RateMyProfessors.com大规模教学评价数据为应用示范,展示如何从道德基础理论视角分析教师评价中的“关怀”、“尊重”和“公平”等因素,并进一步探讨情绪道德计算在教育评价、AI伦理与价值对齐中的应用潜力。
Tutorial目标
参与者将能够:
理解道德基础理论、道德情绪与自然语言处理之间的关系,说明为什么“道德—情绪”信息值得被计算;
区分eMFD/C-MFD、eduMFD、GoEmotions、RoBERTa/MoralBERT 与 LLM方法在文本分析中的优势、局限和适用场景;
掌握基于Prompt的道德/情绪识别基本流程,并能够设计结构化JSON输出模板以支持批量分析;
理解WSL、Docker、vLLM与GPU推理的基本工作流程,掌握 vLLM/PagedAttention 大幅提升推理吞吐的原理,能够复现本地 LLM API 服务的启动与调用,并在单卡环境下实现高通量批量推理;
将所学流程迁移到教育评价、社交媒体、问卷开放题或其他大规模文本数据中,完成初步的道德情绪计算与结果解释。
讲者介绍
南京师范大学教授
毕业于北京大学本科和University of Illinois硕士和博士学位。何吉波现任南京师范大学三级教授,曾任美国航空管理局人因工效卓越研究中心主任,美国Wichita State University终生制副教授。研究方向为驾驶分心,驾驶与航空疲劳,疲劳的生物数学模型和飞行员选拔。主持中国民航管理局、美国民航管理局、参与自然科学基金重点和重大项目,科技部重大研发计划。发表69篇期刊论文, H指数为30。何吉波博士2021年荣获美国发明家学院会士和中国国家级人才专家。近五年内,团队共发表4 篇中科院一区论文,并荣获中国安全生产协会(省部级)技术发明一等奖。
吉林大学教授
中国科学院理学博士、亚利桑那州立大学博士后,本科毕业于北师大哲学系,现任吉林大学哲学社会学院教授、博士生导师。研究兴趣包括人工智能、文化适应、社会认知与计算等。在Journal of Personality、Journal of Cross-Cultural Psychology、《心理学报》《科学通报》等核心期刊发表论文50余篇,多篇政策咨询报告被中央采纳。国际正义研究协会、国际跨文化心理学协会会员,中国心理学会文化心理学专委会、心理学与社会治理专委会、应激与韧性专业委员会(筹)委员,中国社会学会社会心理学专委会委员,中国社会心理学会大数据网络心理学专委会、文化心理学专委会委员。Social Justice Research副主编,Human Behavior and Emerging Technologies编委,Journal of Cross-Cultural Psychology人工智能与文化专刊主编。
南京师范大学硕士研究生
南京师范大学心理学院基础心理学硕士研究生。主要关注知觉决策、证据累积及其神经机制。近期工作聚焦于知觉决策过程中证据累积相关神经信号的提取、量化与建模,并基于Python-MNE对大量使用EEG的知觉决策研究数据开展系统化处理与分析。在项目实践中能够熟练使用Docker搭建与管理科研计算环境,并基于dockerHDDM开展行为数据建模以及EEG-行为数据的联合建模分析。
南京师范大学本科生
南京师范大学心理学院应用心理学(创新实验班)本科生。陈思羽现为南京师范大学心理学院胡传鹏导师Meta-Self实验室成员,研究方向为认知决策、计算神经科学与人工神经网络建模,长期以人工神经网络作为核心技术工具研究认知决策与神经机制。围绕"快同效应的认知机制:基于决策过程的人工神经网络模型"开展工作,将证据积累框架嵌入人工神经网络模型,以复现异同判断任务中的行为现象并解释其认知机制。主持江苏省心理学会2025年度本科生研究基金暨创新实践项目、2025年校大学生创新创业训练计划项目,参与中国科学院脑科学与智能技术卓越创新中心非人灵长类决策任务神经群体记录数据分析项目。以独立第一作者身份在 CSSCI、CSCD 来源核心期刊《心理科学进展》发表综述论文 1 篇,并先后于江苏省心理学会学术年会作口头报告、清华大学“AI 时代的心理认知前沿”学术论坛及“智能协作生态中的心理学与心理建模”学术研讨会作海报报告。陈思羽 2024—2025 学年荣获校级科研创新先进个人称号,于清华大学学术论坛获优秀报告三等奖,并完成 Neuromatch Academy 计算神经科学课程及 Coursera 神经网络与深度学习课程,熟练使用 Python、R、MATLAB、SPSS 等工具。
欢迎参加CNCC2026
CNCC是一个宏观论述技术趋势的大会,具有规格高、规模大、内容丰富等特点,会议形式包括大会特邀报告、大会论坛、专题论坛、特色活动及展览。大会汇聚两院院士、国内外顶尖学者、知名企业家等亲临大会,展望前沿趋势,分享创新成果。ACM、IEEE CS、IPSJ、KIISE等国际计算机组织的代表也多次获邀现场参加这一盛会。CNCC2026将于10月21-24日在四川省成都市举办,大会主题是“数聚驱动,智算未来”,欢迎各界前来参会。
点击“阅读原文”,加入CCF。
