加快建设哲学社会科学高质量数据集

2026-08-27 来源:中国社会科学网-中国社会科学报

微信公众号

分享
链接已复制

  当前,人工智能正深刻改变知识生产方式,推动哲学社会科学研究加快向人机协同转变。习近平主席指出:“每一次科技革命都深刻重构人类生产生活方式,推动经济社会发展大幅跃升。”随着大模型日益深入资料分析、知识发现和辅助研究,数据质量越来越成为影响智能技术辅助研究者认识社会、解释社会的重要因素。建设哲学社会科学高质量数据集,不仅关系模型训练质量,而且关系人工智能能否更好服务知识发现、经验解释和理论创新。

  为哲学社会科学创新发展提供空间

  首先,高质量数据集能够拓展哲学社会科学研究的经验边界。哲学社会科学创新建立在对现实世界充分认识的基础之上。传统研究主要依靠文献研读、社会调查和田野观察获取经验材料,进而形成对具体问题的深入认识,但在处理超大规模、长时间跨度和多类型资料时存在局限。高质量数据集将不同历史时期、不同地区和不同类型的文献资料、调查数据与社会信息进行系统整合,使研究者能够在更大的时空尺度上观察社会结构、制度变迁和群体差异,通过长期追踪和多维比较,识别以往难以发现的新现象、新趋势和新问题,进一步扩大哲学社会科学研究者认识现实、发现问题的经验范围。

  其次,高质量数据集能够拓展哲学社会科学研究的解释边界。社会现象往往由多种因素共同作用形成,其运行机制并不直接呈现在孤立事实之中,重要的知识发现常常蕴含在不同事实、不同层次和不同过程之间且不易直接观察的联系之中。更大规模的数据关联能够为发现新关系、提出新问题和形成新解释提供可能。但数据关系不会自动转化为理论知识,算法发现的模式仍需依赖研究者的问题意识、理论概念和因果判断加以辨析。高质量数据集赋能知识创新的意义,正在于把机器的大规模关系发现能力与研究者的理论解释能力结合起来,推动哲学社会科学研究从更加复杂的事实联系中揭示社会运行机制,由此不断深化对社会规律的客观认识。

  最后,高质量数据集能够拓展哲学社会科学研究的理论边界。中华文明积淀了浩瀚的历史文献,中国式现代化进程又持续产生了大量社会调查、政策实践和基层治理资料,其中蕴含着认识中国社会、解释中国道路的重要知识资源。这些资源往往分散于不同载体、不同研究领域,难以充分进入大规模知识发现和理论建构过程。建设具有中国特色的高质量数据集,使中国丰富的历史与实践资源更加系统地进入人工智能时代的知识生产过程,为研究者从中国实践中发现规律、提炼概念和形成理论提供更加充分的经验支撑,推动研究由运用既有理论解释中国实践,进一步走向从中国实践中提炼原创性概念、理论和方法,不断拓展中国特色哲学社会科学的理论生长空间。

  筑牢哲学社会科学创新根基

  高质量的哲学社会科学数据集,是人工智能准确认识社会事实、有效支撑知识创新的重要前提。人工智能越是深入参与资料分析、知识发现和辅助研究,知识生产对数据质量的依赖就越突出。数据的真实性、可靠性、完整性和充分性,不仅直接影响算法识别和分析的准确程度,也直接关系研究者能否形成符合实际的经验认识。特别是在社会现象复杂多变的情况下,若基础数据存在缺失、失真或结构性偏差,算法处理能力越强,就越可能将局部信息和既有偏差放大为系统性判断。因此,必须加强数据采集、整理、核验和治理,夯实真实、完整、可信的数据基础,为人工智能赋能哲学社会科学研究提供可靠支撑。

  高质量的哲学社会科学数据集,还体现在能够揭示数据之间的知识联系和意义结构上。社会事实并非孤立存在,而是在特定历史进程、制度环境和社会关系之中生成并嵌入,数据的意义往往需要在相互联系中得以准确理解。单个数据即使真实准确,若脱离其形成背景以及与其他社会现象的关联,也难以支撑对复杂社会问题的深入认识。高质量数据集通过语义标注、知识关联和持续更新,将文献资料、调查数据、政策文本、学术成果与研究主题有机衔接,使分散数据形成相互印证、相互解释的知识网络,进而推动数据由事实记录转化为能够支撑问题发现、关系识别和理论解释的知识资源。

  把握高质量数据集建设的正确导向

  第一,坚持“以人为本、向上向善”理念,确保高质量数据集建设始终服务于人的发展和社会进步。对哲学社会科学而言,人工智能的价值不仅在于提高资料处理效率,更在于助力研究者深化社会认识、回应现实问题、增进人民福祉。因此,高质量数据集建设不能单纯以模型性能和技术效率为衡量标准,而应将人的发展需要、社会公共价值和学术进步贯穿于数据选择、组织和使用全过程。要始终坚持研究者在知识生产中的主体地位,使数据和算法服务于人的问题意识、理论判断和价值选择。只有坚持正确价值导向,人工智能才能真正成为促进哲学社会科学创新发展的积极力量。

  第二,强化问题意识,引导哲学社会科学创新扎根中国实践、回应中国问题。人工智能的知识生成高度依赖训练语料及其背后的概念体系,数据进入模型的过程也会影响问题识别和知识表达。建设高质量数据集,要更加系统地汇聚中国历史文化资源、中国式现代化实践以及经济社会发展中形成的丰富经验,推动中国问题、中国案例、中国概念更加充分地进入智能时代知识生产过程。其意义不仅在于增加中国数据,更在于以中国实践校准研究问题、以中国经验丰富理论解释,引导哲学社会科学创新立足中国实际,在回答中国之问、世界之问、人民之问、时代之问中不断形成具有主体性和原创性的知识成果。

  第三,守牢规范有序、安全可控的边界,为哲学社会科学持续创新提供坚实保障。数据资源越丰富,智能技术介入越深入,知识生产面临的个人信息泄露、数据误用、算法偏差以及意识形态和国家安全风险等挑战就越复杂。安全治理的目的不是限制创新,而是为创新划定可信赖、可持续的运行边界。因此要根据数据属性和应用场景,完善分类分级、访问授权、过程留痕和安全审计机制,明确数据开放、共享和使用规则,在有效利用与风险防范之间形成合理边界。只有把价值导向、问题意识和安全规范贯穿高质量数据集建设全过程,才能防止哲学社会科学创新被技术逻辑和既有知识框架牵引,确保人工智能始终沿着服务自主知识体系构建、增进社会福祉的方向发展。

  (作者系福建省习近平新时代中国特色社会主义思想研究中心副主任兼秘书长、福建社会科学院党组书记)

【编辑:张天悦(报纸)赛音(网络)】