核心流程:学者收录流水线 每个学者入网都要走一遍
本网站不是一次性画出来的,而是「按学者逐个收录」长期积累的可复用流水线。每收录一位学者,都走下面 8 步,保证每一条数据可溯源、可重复、不编造。换任何新学者都照这条跑。
1
身份核验 现任单位 · 职称职务 · 研究方向
先确认「这个人是谁、现在在哪里」。任职以现任单位官方现任页为准,已调任学者不凭旧校主页。
渠道
高校学院官网个人主页、学校现任领导页、官方新闻稿
红线
任职变动一律以现任单位官方现任页为准(旧官方个人主页是最常见的过时源)
2
中英文论文收齐 收录一位 = 中英文一次收齐
中文成果与英文成果走两套渠道,绝不只收一边。
中文
期刊题录库(24 本图情期刊约 11.4 万篇题录)→ 知网作者检索 → 万方补缺
英文
OpenAlex(ORCID 核验身份)→ Crossref 补最新 → Web of Science(国际学者)
3
被引核验 每条注明口径
被引数逐篇核验,每条记录注明口径(万方 / OpenAlex / WebSearch),不混用。
渠道
万方被引(精确)→ OpenAlex / Crossref → WebSearch 兜底
原则
查不到填 0 兜底、标注口径,不编造数值
4
节点与边 进图谱 · 带证据
写入 data.js:节点带机构 / 领域 / 简介 / 来源,边带 evidence(可点击溯源)。
节点
姓名(中英)、机构、研究方向、职务、bio、sources 来源链接
边
合著 / 同事 / 合作 / 指导,每条带 strength(1-5)与 evidence 原文证据
5
学者档案 profiles.js
为每位学者建档,bio 用官方口径,多来源冲突时以最新官方发布为准。
内容
履历、职务、研究方向、代表作、官方来源
冲突消解
按最新发布为准,保留证据依据
6
全站同步 一处改 · 全站一致
新增机构要同步三处配色表,静态数字(subtitle / 注释 / 文案)全站 grep 同步,版本号 bump。
机构配色
scholars.html INST_META / app.js INSTITUTION_COLORS / scholar-detail.html INST_COLORS 三表同步
缓存版本
data.js / papers.js / app.js 的 ?v=YYYYMMDDx,三处 HTML 统一升版防浏览器缓存旧数据
7
对抗验证 每次改动必跑
用「模拟用户」的方式验证:全站链接逐条点开、统计数与数据一致、0 console error。
DOM 断言
Playwright 卡片数 = 数据条数、统计 = meta、筛选生效、0 console error
链接审计
全量链接 _verify_all_links.js 逐条跟随重定向,非 200 或跳转失败标红人工复核
8
沉淀归档 数据留档 · 别丢
取证素材归档,新渠道 / 新坑 / 新别名回写记忆,供下一位学者复用。
归档
官方页 HTML、OpenAlex 原始响应、冲突消解证据 → 成长轨迹/data/素材/
回写
新渠道、新坑、新 FORCE_EN 名单、期刊发刊日 → 渠道清单 / sources.js / 项目记忆
作者消歧体系 同名混淆怎么处理
学术数据最大的坑是「同名不同人、一人多名」。消歧只捞候选锚点定归属,不凭印象安机构。别名表已积累 125 条。
一人多名
不同署名 / 中英文名 → 别名表归并(author-registry.js)
一名多人
同名异人 → 按机构 / 领域 / 时间二次判定,命不中不硬凑
跨校存疑
人工确认 + 证据依据,存疑条目标注待定
数据依据
题录库署名脚注、官方页原文,不凭印象安机构
关系类型与证据规则
每条关系边都带 evidence(可点击溯源)。判定标准:合著论文是硬证据;"同领域 + 两校"不算证据,边必须两方互证。
| 关系类型 | 含义 | 证据来源 (可点击溯源) | 图谱样式 |
|---|---|---|---|
| 合著论文 | 共同发表论文(co-authorship,主图 402 条) | 题录库 / 期刊官网 ↗ OpenAlex ↗ | 深灰实线 · 较粗 |
| 同事关系 | 同院系 / 同单位(colleague,31 条) | 机构官网 ↗ | 浅灰点线 |
| 深度合作 | 访学 / 项目 / 学术交流(collaboration,4 条) | 合著 DOI ↗ 官方页 ↗ | 橙色实线 |
| 指导关系 | 博士 / 博士后师生(mentorship,1 条) | 导师页 ↗ | 蓝色虚线箭头 |
期刊官网与检索入口 29 本图情期刊 · 中文题录的权威来源
收录的中文论文题录以期刊官网 / 知网 / 万方为准。已核实的期刊直连官网;官网未核实的期刊用知网期刊导航检索。完整清单与出刊节奏见「数据来源」页。
期刊扫描建库 24 本图情期刊 · 约 11.4 万篇题录
中文论文的核心底座是自建期刊题录库:把图情领域 24 本核心期刊的历年题录(标题 / 作者 / 机构 / 卷期 / DOI)批量抓取建成 JSON 库,作为查全与计量的依据。
工作流
登记 → 官网探测 → 抓取脚本 → 后台长任务 → 数据审计 → 全站同步 → 边界声明
数据源
期刊官网(magtech 等自建系统)+ 万方详情页补缺 + 知网
判重规则
同刊 + 标题 + 年 + 卷期 + 起始页全相同,不用裸复合键(笔谈专栏共享 DOI 会误删)
论文全量扩充 素材库驱动 · 差集补齐
收录学者后,用「期刊题录库 + 素材库」做全量差集审计,把漏掉的论文逐篇补齐并核验被引,而不是只收已发现的路径。
做法
题录库按「刊」提取 → 再拿作者名在全部档案反查做差集 → 补齐缺文
工具
_audit / _fill / _check_dup 脚本族,合并去重后入库
泰斗专区模块 成长轨迹 · 著作墙 · 非学术足迹
对少数领域大牛做深度档案,各模块走独立 SOP。
成长轨迹
官方分期只引用官方来源;我的数据分析一律标注「数据观察 · 非官方」;每条事件可点击溯源
著作墙
OPAC 馆藏核验,独著 / 合著 / 编著等责任方式分类
非学术足迹
贺词 / 纪念文 / 学科建设文章:题录库反查 → 知网目录页 → 公众号检索
对抗式验证 把「验证」当对手
不走过场:每次都模拟真实用户逐条点开,主动质疑自己的产出。
链接
全量 _verify_all_links.js 逐条跟随重定向,新增 URL 重点查、存量按缓存 TTL 复用
统计
node --check 语法 + 统计数 = meta + 数据格式一致性 + 0 console error
编造零容忍
evidence 里每个词都能在所附 URL 找到原文;改完 label / evidence 必须实测抓 URL 搜关键词
版本与备份管理 数据可回退 · 可追溯
每次改动留痕,防止一次误操作毁掉全站数据。
缓存版本
数据文件带 ?v=YYYYMMDDx 版本号,改动后三处 HTML 统一升版
写入前备份
改数据前先存 .bak 备份,异常可回滚
删除规范
删文件走回收站,不永久删除;数据文件留档入项目档案