Lunartulip Lab · AlphaMap 研究笔记 #001

投影本身就是信号的一部分

从 AI 产业语义到股票横截面排序

2026 年 9 月 18 日 · 探索性方法研究

在考察任何收益之前,行业标签的选择就可能决定图分数的大部分内容。

我们搭建了一条从图到排序的端到端试验流程,得到一个明确的测量结果:在这个粗粒度角色投影中,weighted degree 恰好等于一个暴露计数,39 个 Katz 分数里有 31 个可由组规模解释。由此留下一个可用的基线,用来检验更丰富的语义关系和未来的行业状态变化究竟能为股票信号增加多少内容。

39家全球图谱发行人
26只定价股票
1个历史图谱版本

从语义到股票排序的一条可运行路径

AlphaMap 的首个图实验把一套持续维护的 AI 产业本体转换为公司特征、机械化股票排序和假设组合结果。我们把这条可重复的转换链称为图信号工厂(Graph Signal Factory)。它的第一项产出是一个可解释的测量结果:图分数可以复现本体中已经写入的假设。

01 · 输入带日期的语义成员关系
02 · 图谱显式的公司投影
03 · 特征中心性与暴露
04 · 信号控制后的分数与排名
05 · 检验权重、结果与暴露

输入是一组历史上持续维护的发行人—角色与发行人—主题成员关系,按确定性规则投影。其中含 39 家全球发行人;26 只美股具备共同定价样本所需的归档控制数据。我们先在全部 39 家发行人上计算图,再限制组合股票池。角色投影有九个宽口径标签;另一套主题投影使用七项研究视角成员关系。

在这个实验里,共享一个标签就会生成一条同类关系。它并不代表供应合同或客户依赖,也不代表现金流传导的方向。拓扑结构让这一区别直接可见。

图 1. 实际冻结的角色投影,而非供应合同网络。八个连通分量中包含两个孤立节点。块密度反映共享的角色标签;侧栏采用相同的发行人顺序。 PNG · PDF

中心性可能只有暴露层面的解释

39 家发行人中有 37 家只登记了一个角色。由此得到的角色图有八个连通分量。其中七个是正则团,包含两个单点分量,合计 31 家发行人。只有那个八节点的算力/网络分量存在角色重叠。

B 为公司—角色的 0-1 矩阵,fᵣ 为被指派到角色 r 的公司数量,其权重为 qᵣ = 1 + log((N + 1)/(fᵣ + 1))。投影图为 W = B diag(q) Bᵀ,并去掉对角元。它的 weighted degree 恰好为:

strengthᵢ = Σᵣ Bᵢᵣ qᵣ (fᵣ − 1)

该恒等式在全部 39 个节点上成立。在这种构造下,weighted degree 没有在加权角色暴露之外增加任何信息。在规模为 m 的孤立同质角色组内部,每个节点的 weighted degree 都相同,为 d = (m − 1)[1 + log((N + 1)/(m + 1))]。按我们采用的“超出基线”Katz 约定,可得:

k = (I − αW)⁻¹1 − 1
kᵢ = αd / (1 − αd),   α = 0.85 / ρ(W)

该公式在数值精度内复现了这 31 家发行人的实测 Katz 分数。八节点的重叠分量落在这个组规模结论之外。以上是把已有的线性代数恒等式应用到实际数据集,并非新的中心性定理。Katz (1953)

图 2. 两项精确表示检验。全部 39 个节点的 weighted degree 都等于加权角色频次之和。在正则分量内的 31 个节点上,Katz 服从组规模公式;八节点的算力/网络桥接分量明确排除在该公式之外。 PNG · PDF

特征向量中心性在这里更加集中:全部正质量都落在九节点的需求/云分量上,单位长度归一化下每个成员取值 1/3,其余 30 个节点取零。这是分量互不连通及其谱半径差异造成的结果。

TSMC 与 Snowflake 在该投影中各自登记的角色都是独有的,因此没有共享同类。它们的角色分数为零,并不说明其经济重要性。一个可用的信号工厂在把分数低端转成空头组合之前,必须先区分没有登记同类与具有经济含义的低分。

衡量简单暴露之后还剩下什么

在 26 只股票的定价样本上,我们把每个原始分数与它的残差作对比;残差来自对市值对数、研究主题指示变量和主题成员数覆盖度代理变量的联合回归。该设计含截距共九个独立列,残差子空间为 17 维。

图 3. 图中是样本内分数方差,不是被解释的投资收益。控制变量为截距、归档市值对数、研究主题指示变量和主题成员数:9 个独立列、26 个观测、17 个残差自由度。有代数原因的零值已明确标出。 PNG · PDF

在本样本中,控制变量张成了角色 Katz 分数方差的 90.64%,以及主题 Katz 分数方差的 96.84%。这些是特征与控制变量之间描述性的样本内关系。它们不衡量被解释的投资收益、样本外可预测性,也不衡量覆盖度的因果贡献。

两个零残差有确切的原因。主题计数本身就是控制变量;角色特征向量是两个主题指示变量的线性组合。它们的弃权是对设计恒等式的正确处理,并不代表市场独立否定了这两项特征。

因此,对更丰富的图而言,实际问题很明确:在把这些更简单的暴露保留为基线之后,具体的技术、产品或经过验证的经济关系,还能创造出哪些额外信息?

收益对比只能检验设定,无法给出解释

冻结的打分规则生成按并列名次分摊权重的前 20% / 后 20% 配置。我们保留全部六项特征,以及原始分数与残差分数两种处理。下图使用 2026 年 9 月 9 日开盘到 9 月 15 日收盘:共同 26 只股票样本上的五个交易日。

图 4. 2026 年 9 月 9 日开盘至 9 月 15 日收盘;26 只股票的共同样本。分数在排序前经过变换,因此其中的差异不是因果收益分解。† 原始角色计数的并列使每条腿只投入 1/3 美元;其他被评估的腿各投入 1 美元。未计交易成本;不做年化,也不推断 alpha。 PNG · PDF

原始主题 Katz 的 +8.50 个百分点价差,在残差分数排序规则下变为 +0.63 个百分点。选中的股票和权重都发生了变化。这属于设定敏感性;差异无法因果地归因于“被控制变量去掉的 alpha”。原始价差由 −2.26 个百分点的多头腿贡献,与标的空头组合 −10.77 个百分点的收益共同构成。正的价差并不来自上涨的多头账簿。

分数中性化与组合中性化也是两件事。非线性的尾部选股步骤会重新引入暴露。残差角色 Katz 组合保留了对 Memory 的三分之一多头配置,和对 Optical/Networking 的三分之一空头配置,市场 beta 为 +0.257。

图 5. 由残差化分数构建的组合暴露。角色 Katz 保留了明显的主题失衡。主题 Katz 在此处恰好净主题权重为零,但仍保留规模、覆盖度代理和市场 beta 暴露。研究主题并不等同于 GICS 行业分类。 PNG · PDF

这些收益是来自单一回溯设计版本的探索性诊断。每条腿的预分配预算为 1 美元;重叠的并列相互抵消,对应的额度保持未投放。原始角色计数每条腿只投放 1/3 美元,因此它的原始/残差配对不构成等额投放的对比。其他所有被评估的组合每条腿投放 1 美元。价差是每 1 美元参考配置的盈亏,不是已出资组合的收益率。

把本体分辨率变成可反驳的研究计划

这项试验建立了一条从语义成员关系到可审计股票排序的可重复路径。它的实质贡献是指出表示方式在哪些地方决定了分数,这让下一步在图质量上的投入变得可以检验。

下一步研究改变什么什么结果才能支持增量价值
投影与分辨率加入具体产品/技术,以及有类型、有证据的公司关系;显式记录缺失情况。在角色计数、组规模、覆盖度和同一合格股票池之外出现有用的变化;并与合适的保结构零模型作对比。
动态行业状态为经济关系附加可比、带日期的状态修订和显式传导规则。在完全相同的信息集上,传导状态特征优于只用公司自身状态和中心性的特征。
多版本重复验证在新结果出现之前冻结数据处理与组合规则;纳入交易日历、证券生命周期、风险约束和成本。在独立日期和事件簇上表现稳定,且实施假设现实、检验方案事先声明。

借助大语言模型做抽取,是填充更细粒度语义输入的一条可行途径。本实验没有衡量它的抽取准确率或投资贡献。同样,动态状态传导仍是一个独立且未经检验的收益假设。本系列后续条目会把这些贡献直接量化出来,而不从一条能跑通的排序流程去反推它们。

研究范围与数值附录

设计。回溯性探索构造研究。图记录归档于 2026 年 9 月 8 日;市值/主题控制数据在假设的 9 月 9 日建仓之前归档。本实验是在其 1 日和 5 日结果出现之后设计的。输入数据在历史上可得,并不能使本研究成为前瞻性研究。七只外国上市证券仍留在图中,但不参与这次以美股交易日历为准的组合检验;另有六只美股缺少所需的归档控制数据。样本经过人工挑选,不是宽基市场股票池。

价格与实施。使用 Yahoo Finance 历史调整价,于 2026 年 9 月 17 日获取。收益代理:调整后的离场收盘价,除以按建仓日调整比例缩放的建仓开盘价,再减一。只计入已完成的交易日,固定截止于 9 月 16 日。市场 beta 使用建仓前最多 252 个、至少 120 个日收益率;静态对冲诊断扣减组合 beta 乘以对应期间 SPY 的持有收益。成本情景按交易名义金额(调整价值)每绝对美元 10/25/50 个基点计算,并非完整的公司行动、融资或融券台账。

推断。六种特征定义、两种分数处理和两个已成熟的持有期,共产生 24 个报告单元:20 个评估结果和 4 个弃权。它们共用同一个建仓日。无约束的发行人标签置换只作为内部诊断保留,不声称任何针对特定拓扑的显著性。计划中的 20 日跟踪在本次截止日尚未完成,即使完成,也仍属于这一经过挑选的历史样本。本文不推断年化 alpha、夏普比率、发现性 p 值或动态传导的表现。

全部 1 日与 5 日结果,含投放名义金额
交易日数特征打分方式多头 / 空头(美元)毛盈亏(百分点)静态 beta 对冲后(百分点)25bp 成本代理(百分点)
1角色强度原始1.000 / 1.000-0.83-0.78-1.83
1角色强度残差分数1.000 / 1.000+0.54+0.53-0.47
1角色 Katz原始1.000 / 1.000-1.88-1.76-2.88
1角色 Katz残差分数1.000 / 1.000+0.61+0.66-0.40
1角色特征向量原始1.000 / 1.000-2.63-2.64-3.62
1角色特征向量残差分数弃权弃权弃权
1主题 Katz原始1.000 / 1.000+1.26+1.04+0.27
1主题 Katz残差分数1.000 / 1.000+0.96+0.94-0.03
1角色计数原始0.333 / 0.333+0.91+0.92+0.58
1角色计数残差分数1.000 / 1.000-0.67-0.70-1.67
1主题计数原始1.000 / 1.000-0.90-1.08-1.90
1主题计数残差分数弃权弃权弃权
5角色强度原始1.000 / 1.000-1.36-1.16-2.33
5角色强度残差分数1.000 / 1.000-2.61-2.64-3.57
5角色 Katz原始1.000 / 1.000-0.73-0.24-1.69
5角色 Katz残差分数1.000 / 1.000-2.31-2.08-3.26
5角色特征向量原始1.000 / 1.000-0.40-0.47-1.36
5角色特征向量残差分数弃权弃权弃权
5主题 Katz原始1.000 / 1.000+8.50+7.62+7.54
5主题 Katz残差分数1.000 / 1.000+0.63+0.55-0.32
5角色计数原始0.333 / 0.333+1.33+1.36+1.01
5角色计数残差分数1.000 / 1.000-3.01-3.16-3.97
5主题计数原始1.000 / 1.000+3.61+2.91+2.65
5主题计数残差分数弃权弃权弃权

金额均以 1 美元参考配置计。beta 对冲后与成本压力后的数字是彼此独立的诊断,不构成一个联合出资的净策略。弃权保持零暴露,不强行给出排名。

学术背景。Tony Guida 的 Paid to Be Central: Semantic Networks and the Cross-Section of Returns,发表于 2026 年 9 月 16 日的 CQF Institute 会议,启发了这里的网络位置基线。我们这套窄口径本体投影并不构成对他的语料或所报告策略的复现。中心性约定遵循 Katz (1953);实用的数学参考见 NetworkX 文档。图表与计算:Lunartulip Lab,冻结的 AlphaMap 实验 001 输入。