ALIYUN × CHINA MOBILE · DATA PIPELINE DESIGN
数据链路设计
从广东移动经分(BASS)数据 → Qoder / QoderWork 潜客打标 → 外呼号码包 —— 一图看懂选表、建模、打分、回写全过程
◆ AI²Loop · 卖 AI 的 AI · 数据地基 ◆
1
数据字典三张核心 sheet
读懂它们,才能从 7,420 张表里精准选表
填写说明
字典的字典
先读这张
- 定义"模型索引/模型结构"每一列的口径
- 确认数据域 B/O、模式名 EDS/REF 含义
- 确认敏感级别与脱敏规则 → 合规红线
模型索引
7,420 行 = 全库表清单
表级筛选
- 每表一行:域/模式/主题域/分区/字段数
- B 域 6,999 · EDS 1,032 · REF 577
- 漏斗收敛到 ~20 主用表 + ~20 辅助表
模型结构
140,250 行 = 字段清单
字段级下钻
- 每字段一行:中文名/类型/主键/敏感级
- 标注识别键 / 画像特征 / PII 敏感
- 产出"字段→打标用途"映射矩阵
2
选表漏斗:7,420 → 20
可复现的表级筛选,不靠拍脑袋
▼ 只留 B 域(业务支撑,剔除网管)
▼ 只留可直接用的模式
S2 模式 = EDS + REF(明细宽表+维表)
≈1,600
▼ 主题域命中画像七层
S3 用户/客户/终端/位置/集团/标签/产品
≈200
▼ 表名关键词精确锁定
S4 USR/GCUST/APP/IMEI/LACI…
≈40
▼ 人工确认字段数/开放/分区
3
六工序流水线
每道工序有输入、输出、验收口径,对应 07_engineering/sql
工序 0
元数据解析
三 sheet → 漏斗选表
出:候选表+字段矩阵
工序 1
圈表选字段
定 JOIN 键与特征列
出:19 表 DDL
工序 2
建宽表
pers_usr_m 驱动 LEFT JOIN
出:一行一号码宽表
工序 3
特征工程
七层特征归一化分层
出:12 个特征因子
工序 4
双画像打分
加权求和 + 阈值 0.6
出:双分双 target
工序 5
标签回写+外呼
落 LAB_CD → 号码包
出:外呼名单
4
双画像评分模型
七层画像加权,score ≥ 0.6 命中打标
Qoder_Score
程序员 / IT技术岗 / 科技集团员工
命中 → 打 L_QODER_TARGET 标签
QoderWork_Score
泛白领 / 知识工作者 / 商务办公人群
命中 → 打 L_QWORK_TARGET 标签
打完标签的号码包进入智能外呼 → 客户开通 Qoder/QoderWork → 使用行为沉淀新意图数据 →
T+1 反哺打分模型(识别更准)· T+7 反哺话术库(转化更高)—— 这就是 AI²Loop 自增长飞轮。