为什么这么整理 数据整理的思路与逻辑
本页沉淀「数据从哪来、为什么这么整理、怎么持续更新」的完整逻辑。 下方为构建流程与数据来源体系:先圈定领域与目标学者,再收集画像与关系,清洗量化后可视化呈现; 数据侧维护期刊体系并标注出刊节奏,目标学者名单驱动轮巡,跟踪渠道覆盖官网 / 知网 / 公众号 / OpenAlex, 所有数据只收录可核验来源。
1
确定范围 先圈定"画谁"
明确领域边界、目标学者名单和时间窗口。范围决定网络的大小与深度。
领域界定
如"图书情报学(LIS)",可交叉科学计量、信息资源管理等领域,再细分信息行为、数据治理等子方向
目标名单
领域公认大牛 → 导师与合作者 → 青年学者,逐层圈定
时间窗口
无窗口限制:收录学者的全部学术履历与论文,以便完整呈现师承传承与合作脉络
2
收集学者信息 每个节点的"画像"
为每位学者建立基础档案,字段越完整,图谱的详情面板越有价值。
身份字段
姓名(中英文)、机构、职称职务、邮箱/主页链接
学术字段
研究方向标签(2-3个)、简介、h指数、代表作
获取渠道
学院官网个人主页、Google Scholar、OpenAlex、知网学者库
3
收集关系信息 网络的"连线" · 最关键
这是最有价值也最费力的部分,4种关系对应4类信息源:
合著论文(最硬的关系)
共同发表的论文列表、次数 → CNKI、Web of Science、OpenAlex
指导关系
博士/博士后导师、师门传承 → 个人主页教育背景、导师介绍页
同事关系
同院系、同实验室、同期刊编委 → 学院官网、期刊编委名单
项目合作
共同承担的基金课题 → 国家自然科学基金/社科基金项目库
4
清洗与量化 让网络"有可信度"
原始数据往往存在同名混淆、强度模糊等问题,需要规范化处理。
消歧去重
同名学者合并为正确节点;同一学者中英文名、不同署名对应同一人
强度打分 (1-5)
合著5篇以上=5 / 3-4篇=4 / 1-2篇=3 / 同事项目=2 / 一般交流=1
关系方向
指导关系有方向(导师→学生)用虚线箭头,其他关系无方向
5
可视化呈现 自动生效
把整理好的数据填入 data.js 的 nodes 和 links 数组,图谱、名单页、筛选、搜索全部自动生效。
力导向图谱
节点=学者、连线=关系,拖拽/缩放/点击查看详情
学者名录页
按机构分组的卡片式展示,一键跳转图谱
筛选与搜索
按关系类型/机构筛选,按姓名/方向/机构实时搜索
关系类型速查表
| 关系类型 | 需要的信息 | 获取渠道 | 图谱样式 |
|---|---|---|---|
| 合著论文 | 共同发表论文列表、合作次数 | CNKI / Web of Science / OpenAlex / Google Scholar | 实线较粗 |
| 指导关系 | 博士/博士后导师、师门传承 | 个人主页"教育背景"、学院导师介绍页 | 虚线箭头 |
| 项目合作 | 共同承担的基金课题、合作项目 | 国家自然科学基金 / 社科基金项目库 | 实线较细 |
| 同事关系 | 同院系、同实验室、同期刊编委 | 学院官网、期刊编委名单页 | 点线 |