StarTalent Engine 是一个数据驱动的 AI 人才培训课程生成器。
核心命题: 合法招聘数据 → 人才技能图谱 → 合规 AI 培训课程
INPUT: 公开招聘数据 (1,043条) → 引擎处理 → OUTPUT: 合规课程大纲
内部人才数据 → 市场报告
市场信号 → 个人学习路径
治理引擎贯穿所有层。
| 组件 | 用途 | 在你的环境中的对应 |
|------|------|-----------------|
| Firecrawl (双Key轮训) | 主流招聘网站采集 | N/A (需要API Key) |
| Tavily Search | 补充采集 + 搜索 | 你已有 Hermes Tavily 工具 |
| Web Extract | 单页面信息抽取 | web_extract 工具 |
| 组件 | 作用 | 技术栈 |
|------|------|-------|
| DuckDB | 嵌入式 OLAP 数据库 | Python + SQL |
| dbt | 数据转换 (stg→dim→fact→analysis) | SQL + YAML |
| Domain Registry | 领域插件系统 (4+N) | Python 热插拔 |
| 分析管道 | 输入 | 输出 |
|---------|------|------|
| LLM Insight Pipeline | 清洗后的 JD 数据 | 结构化技能/痛点表 |
| Skill Gap Analysis | 技能频率 + 薪资数据 | 技能缺口报告 |
| Trend Detection | 时间序列采集数据 | 增长/衰退趋势 |
| 产品 | 输入 | 输出 | 对应课程 |
|------|------|------|---------|
| Course Generator | analysis_* 表 | 课程大纲 .md | AI治理/FDE/FINAI |
| Market Report Engine | 六维数据 | 市场分析报告 | 产品经理培训 |
| Talent Assessment | 技能图谱 | 个人评估报告 | 职业规划 |
| 循环 | 频率 | 触发 |
|------|------|------|
| Fast Loop | 每周一 6:00 | 采集 → 分析 → 更新课程 |
| Medium Loop | 每周一 7:00 | 策略评估与调整 |
| Slow Loop | 每月 1 日 | 新域发现与插件扩展 |
对应 L4 课程: M4.1 + M4.2 + References
目标岗位: AI治理工程师 / 数据合规工程师
目标薪资: 40K-52K/月
对应 docs/courses/FDE_COURSE_OUTLINE.md
目标岗位: AI Agent部署工程师 / AI安全工程师
目标薪资: 38K-120K/月
模块一: AI治理基础与部署环境 (W1-3)
模块二: 大模型安全与红蓝对抗 (W4-6) ← 最值钱
模块三: AI Agent开发与数据工程 (W7-9) ← 最高频
模块四: 综合实战与求职冲刺 (W10-12)
对应 ai_product_app_manager_training_outline.md
目标岗位: AI产品经理
目标薪资: 35K-65K/月
市场发现: AI Agent需求环比+50%, 大模型部署需求环比+40%, AI安全极度稀缺
从 StarTalent 源码中提取的核心模式。
# 1. 领域注册 + 热插拔插件模式
class DomainPlugin:
"""领域插件的基类 — StarTalent 的插件系统"""
def __init__(self, name, keywords, config=None):
self.name = name
self.keywords = keywords
self.config = config or {}
def match(self, text):
"""检查文本是否属于本领域"""
return any(kw.lower() in text.lower() for kw in self.keywords)
def transform(self, data):
"""自定义数据转换逻辑"""
raise NotImplementedError
class DomainRegistry:
"""领域注册中心 — 管理所有插件"""
def __init__(self):
self.plugins = {}
def register(self, name, plugin):
self.plugins[name] = plugin
print(f"[Registry] 插件 '{name}' 已注册")
def unregister(self, name):
self.plugins.pop(name, None)
print(f"[Registry] 插件 '{name}' 已卸载")
def find_matching(self, text):
return [p for p in self.plugins.values() if p.match(text)]
print("✓ Domain Registry 模式 (热插拔插件系统)")# 2. 双闭环数据管道模式
class DataPipeline:
"""数据管道: 采集 → 清洗 → 转换 → 分析 → 输出"""
def __init__(self):
self.stages = []
def add_stage(self, name, fn):
self.stages.append((name, fn))
return self # 链式调用
def run(self, data):
for name, fn in self.stages:
print(f"[Pipeline] 执行: {name}")
data = fn(data)
return data
# 3. LLM 结构化输出模式 (用于 course generator)
import json
def llm_analysis(prompt, json_schema, client, model="Qwen3.5-9B-Q4_K_M.gguf"):
"""调用 LLM 并强制输出 JSON 结构化数据"""
r = client.post("/chat/completions", json={
"model": model,
"messages": [
{"role": "system", "content": f"输出严格的JSON格式,schema: {json.dumps(json_schema, ensure_ascii=False)}"},
{"role": "user", "content": prompt}
],
"temperature": 0.1,
"response_format": {"type": "json_object"}
})
return json.loads(r.json()["choices"][0]["message"]["content"])
print("✓ 结构化分析管道 (Power StarTalent Layer 3+4)")# 4. Auto-Loop 调度模式
class AutoLoop:
"""自治循环: StarTalent Engine 的"心跳"""
def __init__(self, pipelines=None):
self.pipelines = pipelines or {} # {name: DataPipeline}
self.state = {"cycle": 0, "last_run": None, "domains": {}}
def fast_loop(self):
"""每周: 采集 → 清洗 → 分析 → 课程更新"""
print("[Fast Loop] 开始...")
self.state["cycle"] += 1
self.state["last_run"] = "fast"
def medium_loop(self):
"""每周: 策略评估与调整"""
print("[Medium Loop] 策略评估...")
def slow_loop(self):
"""每月: 新域发现"""
print("[Slow Loop] 扫描新领域...")
loop = AutoLoop()
loop.fast_loop()
print(f"\n循环次数: {loop.state['cycle']}")书1: Build LLM from Scratch
├── Ch1-2: 分词/嵌入 → StarTalent 数据采集层
├── Ch3-4: 注意力/GPT架构 → StarTalent 智能引擎
├── Ch5-6: 训练/微调 → FDE 课程模块一
└── Ch7: 指令微调 → AI治理模块 (安全对齐)
书2: Build Reasoning Model
├── Ch1: 推理方法 → StarTalent 推理引擎优化
├── Ch2: KV Cache → 本地模型推理加速
└── Appx C: Qwen3源码 → FDE课程模块三 (模型部署)
L4 课程
├── M4.1 治理体系 → FDE模块一 + AI治理认证班
├── M4.2 数据合规 → FDE模块一 + 产品经理培训
└── References → FDE模块二 (红蓝对抗)
StarTalent Engine
├── Layer 1-2 → 数据工程 (Python + DuckDB + dbt)
├── Layer 3-4 → LLM 推理 + 课程生成
├── Layer 5 → Agent 自治循环 (Cron调度)
└── 治理贯穿 → AI治理认证班核心
你不仅仅是"学 Python"——你是在构建一个从技术到产品的完整闭环:
| 角色 | 对应模块 | 核心能力 |
|------|---------|---------|
| Python 开发者 | 所有 notebook | API 调用、数据处理、模型训练 |
| AI 治理专家 | L4 + 治理引擎 | 算法备案、数据合规、模型审计 |
| 模型部署工程师 | FDE 课程 + KV Cache | K8s部署、推理优化、安全防护 |
| AI 产品经理 | 产品经理大纲 | 市场分析、需求定义、课程设计 |
| SaaS 架构师 | StarTalent 架构 | 系统设计、热插拔插件、自治循环 |
> 学习路径建议: 先补完 05-10 的基础 notebook → 理解 StarTalent 架构 → 尝试改进课程生成管道