为什么这么整理 数据整理的思路与逻辑

本页沉淀「数据从哪来、为什么这么整理、怎么持续更新」的完整逻辑。 下方为构建流程与数据来源体系:先圈定领域与目标学者,再收集画像与关系,清洗量化后可视化呈现; 数据侧维护期刊体系并标注出刊节奏,目标学者名单驱动轮巡,跟踪渠道覆盖官网 / 知网 / 公众号 / OpenAlex, 所有数据只收录可核验来源。

1
确定范围 先圈定"画谁"
明确领域边界、目标学者名单和时间窗口。范围决定网络的大小与深度。
领域界定
如"图书情报学(LIS)",可交叉科学计量、信息资源管理等领域,再细分信息行为、数据治理等子方向
目标名单
领域公认大牛 → 导师与合作者 → 青年学者,逐层圈定
时间窗口
无窗口限制:收录学者的全部学术履历与论文,以便完整呈现师承传承与合作脉络
2
收集学者信息 每个节点的"画像"
为每位学者建立基础档案,字段越完整,图谱的详情面板越有价值。
身份字段
姓名(中英文)、机构、职称职务、邮箱/主页链接
学术字段
研究方向标签(2-3个)、简介、h指数、代表作
获取渠道
学院官网个人主页、Google Scholar、OpenAlex、知网学者库
3
收集关系信息 网络的"连线" · 最关键
这是最有价值也最费力的部分,4种关系对应4类信息源:
合著论文(最硬的关系)
共同发表的论文列表、次数 → CNKI、Web of Science、OpenAlex
指导关系
博士/博士后导师、师门传承 → 个人主页教育背景、导师介绍页
同事关系
同院系、同实验室、同期刊编委 → 学院官网、期刊编委名单
项目合作
共同承担的基金课题 → 国家自然科学基金/社科基金项目库
4
清洗与量化 让网络"有可信度"
原始数据往往存在同名混淆、强度模糊等问题,需要规范化处理。
消歧去重
同名学者合并为正确节点;同一学者中英文名、不同署名对应同一人
强度打分 (1-5)
合著5篇以上=5 / 3-4篇=4 / 1-2篇=3 / 同事项目=2 / 一般交流=1
关系方向
指导关系有方向(导师→学生)用虚线箭头,其他关系无方向
5
可视化呈现 自动生效
把整理好的数据填入 data.js 的 nodes 和 links 数组,图谱、名单页、筛选、搜索全部自动生效。
力导向图谱
节点=学者、连线=关系,拖拽/缩放/点击查看详情
学者名录页
按机构分组的卡片式展示,一键跳转图谱
筛选与搜索
按关系类型/机构筛选,按姓名/方向/机构实时搜索
关系类型速查表
关系类型 需要的信息 获取渠道 图谱样式
合著论文 共同发表论文列表、合作次数 CNKI / Web of Science / OpenAlex / Google Scholar 实线较粗
指导关系 博士/博士后导师、师门传承 个人主页"教育背景"、学院导师介绍页 虚线箭头
项目合作 共同承担的基金课题、合作项目 国家自然科学基金 / 社科基金项目库 实线较细
同事关系 同院系、同实验室、同期刊编委 学院官网、期刊编委名单页 点线
进阶建议:图书情报学及交叉领域可以优先用 OpenAlex(免费开放)——输入学者名即可导出全部论文和共作者,自动生成合著网络,比人工整理高效得多,还能直接获得关系强度数据。
核验原则:只收录可核验来源;官网 URL 仅在核实后填写,否则一律用知网 / 公众号检索;所有新增轨迹条目都要拿到具体新闻页作为来源,不编造、不脑补。