7月26日下午,第四届语料库与数字人文暑期学院首场企业论坛在南京师范大学随园校区贻芳报告厅举行。来自百度飞桨、阿里巴巴Token Hub、字节跳动、中华书局古联公司、江苏省舜禹信息技术有限公司及南京投石科技有限公司的专家学者,为在场270余位海内外学员带来了一场产学研深度融合的学术分享。
百度飞桨教育生态运营负责人钱芳以“AI正在如何改变数字人文”破题。她指出,人工智能的发展不仅依赖算法与算力,更取决于专业领域知识与行业认知的深度注入。她以《辞海》智能审校为例,展示了大模型在逻辑矛盾识别与知识溯源上的独特优势,并以海外华人寻根、科研学术辅助等案例,呈现AI从效率工具向能力拓展者演进的多元路径。同时,审美、创造力与知识体系是人的三大核心优势——AI能力越强,对人的专业素养要求越高。基于招聘平台数据分析,她归纳出模型建设、产品创新、产品运营与行业应用四大岗位方向,并勉励学员:“数字人文不只是拥抱AI,更是让AI理解人类的文明。”

阿里巴巴Token Hub事业部算法专家李海军从数据视角剖析了大模型落地的关键逻辑。他指出,大模型性能高度依赖于预训练阶段注入的行业认知与数据质量。人文社科领域文化背景复杂,需专家深度介入语料治理。他系统梳理了从海量网页抓取到知识数据构建的全链路流程,强调最终仅有极少数高质量内容沉淀为训练语料。在阿里国际电商实践中,人机协同标注使模型精准捕捉消费心理,生成地道的本土化译文。多模态方面,他以虚拟试穿为例,提出质量、多样性、复杂性、幻觉控制四大评估维度,强调须从数据源头建立幻觉防线。

字节跳动公益古籍项目经理张明月介绍了“识典古籍”平台。面对古籍整理任务繁重、专业力量不足、大众阅读存在门槛等痛点,平台目前已公益开放约7万部古籍,为6000余个专业团队提供支持,App累计下载超160万次。平台每日约35万人次检索古籍资料,相关功能已深入高校科研及课堂教学场景。“我用AI校古籍”活动吸引约6万人参与,累计整理约21亿字,让公众成为古籍保护的参与者。

古联(北京)数字传媒科技有限公司古籍实验室主任苏瑞欣指出,古籍整理出版正从“文本数字化存储”向“知识化、智能化体系构建”演进。古联公司依托自主研发的AI技术构建了覆盖底本数字化、整理校勘至编辑校对的智能工具矩阵,版刻OCR识别率突破99%。基于超50亿字数据库及协同标注体系,古联公司突破传统“翻阅查证”模式,将其升级为定制化专题研读与成果自动产出的高效闭环,显著降低了古籍整理的专业门槛。

江苏省舜禹信息技术有限公司专家王璐指出,大模型大幅压低文本生成边际成本后,高质量语料、可解释的研究方法与可落地的业务服务设计成为语言服务行业真正的稀缺资源。他以专利数据为语料库样本,拆解历时演变、国别差异、错误标注三类研究方法,对应呈现风格基线搭建、区域本地化适配、智能质量治理等产业场景,为语言服务边界拓展提供了清晰参考。

南京投石科技有限公司创始人孙峰峰展示了“气韵再生”AI绘画模型及多模态交互技术在传统文化转译中的应用成果。公司依托与南京大学等超100所高校的产学研协同,结合超十年大型灯光节、地标AR秀的实践积淀,将AI艺术从个体碎片化生成推向系统化落地。通过定向风格迁移、跨模态全感官沉浸与人机共创等能力,公司成功将传统文化转化为嵌入商场、展馆与城市公共空间的文旅体验,为中华优秀传统文化的当代表达开辟了新的可能。

在交流研讨环节,与会专家围绕AI文化产品商业化与人文专业学生职业发展等话题展开深入交流。专家表示,大模型向科研与行业应用持续深入,具备扎实专业功底、能够理解技术并善于提出问题的复合型人才将更受重视,勉励学员在实践和持续输出中完善知识体系、提升创新能力。


