GF.冯冠华
DATA · AI · BUSINESS

冯冠华Guanhua Feng

用数据理解问题,
用模型探索答案。

应用数据分析硕士,经济学学士。从金融研究、外贸运营到数据仓库、计算机视觉与 AI 智能体,将数据与技术应用于具体问题。

BOSTON UNIVERSITYNOTTINGHAM NINGBO
07核心项目
04实习经历
02跨学科学位
01 / EDUCATION

教育背景

波士顿大学

应用数据分析硕士 · 波士顿(美国)

相关课程:机器学习与预测分析、强化学习、高级数据库管理(SQL Server)、数据仓库与商业智能、数据可视化(Tableau)、Python / R 数据分析、数据挖掘、人工智能、算法。

宁波诺丁汉大学

经济学学士 · 国际经济与贸易 · 宁波 / 诺丁汉(英国)

相关课程:宏观经济学、微观经济学、计量经济学、数理逻辑与统计、国际经济学。

02 / EXPERIENCE

实习经历

长江证券宁夏分公司

对公业务助理 · 银川

  • 参与控鲜科技与长城资管相关不良资产投资项目的融资和收益测算;参与医院设备更新、物流园区专项债申报,整理并核对投资、融资与偿债测算表。
  • 参与晓鸣股份相关蛋清、蛋液产业并购项目,结合收益法与市场法研究目标公司 300 余页业务、财务及现金流资料,为估值和业务分析提供支持。
  • 整理陕甘宁蒙硅铁行业与企业资料,为研究所提供数据汇总及简报;另梳理甘宁青新能源、算力、新材料等产业及机构业务机会。

上海宾臣进出口有限公司

数据分析与业务运营助理 · 上海

  • 参与企业网站与云数据库搭建,使用 SQL 取数分析、Tableau 展示结果,并通过 Markdown 整理业务文档。
  • 分析汽车配件客户需求与竞品信息,结合采购、库存、物流及清关环节整理运营信息,支持选品与客户跟进。
  • 参与海外渠道拓展,将客户来源由展会延伸至海外社交媒体;网站单日独立 IP 达 1,000+

中泰证券宁夏分公司

投顾助理 · 银川

  • 参与 30 余只债券型及混合型基金的销售支持,提出 3 只基金的重点推广建议,其中 2 只被采用。
  • 策划 2 位基金经理参与的电话会议与直播,使用 Excel 和 R 分析投资者人群分布与反馈,归纳 6 类核心关注问题,为活动内容与产品沟通提供依据。
  • 参与期间,地区新发基金销售额环比增长 32%;该指标为团队业务表现。

兴业证券宁夏分公司

数据分析助理 · 银川

  • 参与硅铁行业研究,使用 Wind 整理行业与公司数据;参与 3 篇研报整理,建立研究分析所需的资料基础。
  • 围绕研报评级、机构持股比例、资产规模与累计超额收益率的关系开展研究,独立撰写 26 页分析报告,并在周例会上汇报。
03 / SELECTED PROJECTS

从方法到结果

从业务分析到模型实验与工作流,查看方法、结果和迭代过程。

7 / 7
01 / COMPUTER VISION

疲劳驾驶检测系统

将视频输入拆解为人脸检测、20 点关键点回归、EAR / MAR 状态分析与 LSTM 时序分类,构建可解释的四阶段计算机视觉原型。

TensorFlowMobileNetV2OpenCVLSTM
591时序样本
82.35%最终验证准确率
0.779F1 · 阈值 0.5
工程方法与评估边界

构建 5×11 特征窗口,输入长度为 5 的 LSTM 序列;采用合成数据预训练和真实视频微调。通过 NMS、检测框尺寸过滤、损失权重调整,以及 BGR→RGB 和归一化修正改善级联流程。

472 个训练样本 / 119 个验证样本,真实数据微调 30 轮。验证集来自随机划分的时序窗口,尚不代表跨驾驶员或独立视频泛化能力。

LSTM training and validation accuracy and loss over 30 epochs
Notebook 原始训练曲线
MODEL EXPLORER

决策阈值与漏检的取舍

验证集混淆矩阵 · 行为真实类别,列为预测类别
实际 / 预测清醒疲劳
清醒618
疲劳1337

阈值 0.3 将疲劳召回率从 74% 提升至 90%,同时增加误报。

来源:项目报告 §5;Notebook cells 17–19。展示已保存结果。

02 / RISK MODELING

波士顿枪击风险建模

分析 2023.01—2025.04 的 178,016 条波士顿警方公开事件记录,围绕仅占 0.70% 的枪击事件构建极不平衡二分类模型。

XGBoostRandom ForestSMOTESpatial Features
178,016事件记录
85%测试集召回率
0.816ROC-AUC
特征工程与结果解读

结合小时、星期、月份等日历特征,0.003° 经纬度网格,以及同一网格前 14 天枪击次数;使用类别权重、SMOTE 和 XGBoost 正类权重处理不平衡,并以 PR-AUC 比较模型。

测试集识别 240 起枪击事件中的 204 起,精确率 1.7%、F1 0.033。高召回仍伴随大量误报;此项目为离线课程分析,未作为实时警务系统部署。

MODEL COMPARISON

稀有事件,更关注 PR-AUC

Logistic Regression0.028
Random Forest0.030
XGBoost0.031
0PR-AUC0.040
204 / 240测试集枪击事件被识别
Precision 1.7% · 极不平衡任务

来源:project-final.pptx,第 4、7、8 页。三个模型使用各自的类别不平衡处理方案。

03 / NLP & NETWORKS

Wikipedia 知识图谱与主题分析

从人工智能词条链接中抽取 50 篇 Wikipedia 页面,结合文本语义和页面链接,分析主题结构与知识网络中的重要节点。

TF-IDFLSAK-MeansLDANetworkX
50 / 78页面 / 有向链接
5,000TF-IDF 特征
3最佳主题数量
方法、图谱与聚类结果

使用 unigram / bigram TF-IDF、L2 归一化和余弦距离,比较 K-Means(k=5)与平均连接层次聚类。通过 LDA 的 c_v 一致性选择主题数,用 PageRank(α=0.85)识别中心页面,并构建 49 条边的最小生成树。

三类主题大致覆盖 AI 技术应用、社会政治讨论及哲学历史视角。样本较小,Notebook 存在 LDA 收敛提示,主题结果适合作为探索性分析。

Original 2D SVD projection of 50 Wikipedia pages colored by K-Means cluster
原始结果:二维 SVD 投影与 K-Means 聚类
TOPIC EXPLORER

主题数量如何影响一致性

0.3826c_v coherence
0.3826
3
0.3511
4
0.3401
5
0.3197
6
0.3009
7
0.2972
8

k = 3 在已测试的 3—8 个主题中获得最高一致性。

来源:optimal_pro.ipynb,cells 0–10;Guanhua.docx。

04 / NETFLIX · DESIGN STUDY

Netflix 内容数据仓库设计

作为内容分析设计练习,以 Netflix 影视内容目录为主题,围绕电影与剧集、类型、国家或地区及年份组织分析维度,将 SQL Server 数据仓库建模、ETL 与 Tableau 看板串联为完整的商业智能设计。

NetflixSQL ServerETLSCD Type 2Tableau
建模设计与分析视角

建模设计:以影视条目为核心,关联内容类型、题材、地区和时间维度;对多题材、多地区的关联采用桥接结构,避免直接展开后重复计数。

数据流程:通过 ETL 统一日期与字段格式、处理缺失值和重复条目;将 SCD Type 2 用于需要保留变更历史的维度属性。

分析视角:比较电影与剧集的内容结构、不同题材和地区的目录分布,以及发行年份与入库年份的变化。看板围绕内容供给构成展开,不将目录条目数量解释为观看量或收入。

NETFLIX / CONTENT ANALYTICS

从内容目录到分析看板

01内容目录
02清洗与转换 · ETL
03内容、题材、地区与时间维度
04Tableau 内容分析看板
内容结构 · 地区分布 · 年份趋势
05 / DATA WAREHOUSE

多源金融数据仓库与 BI

整合美股指数、比特币行情与宏观指标,把多源数据清洗、维度建模、SQL 装载与 Tableau 探索分析串联起来。

SQL ServerpandasETLTableau
3数据来源
4 + 6事实表与维度表
数据工程与分析口径

使用 pandas 处理日期、日月频率和字段类型,将暂存层数据通过 SQL 装载至事实表。数据模型覆盖股票指标、加密资产行情、宏观影响和月度市场表现。

以 Tableau 比较 RSI 区间下的次日收益及宏观冲击后的波动。分组比较属于描述性探索,不能推断因果影响;月度宏观数据应按实际发布日期对齐,避免未来信息泄漏。

SOURCE → MODEL → INSIGHT

三类数据,一套分析模型

Yahoo FinanceCoinGeckoFRED
清洗与日期对齐pandas → SQL
事实表4
维度表6
跨市场探索分析Tableau
Financial warehouse schema with four fact tables and six dimensions
项目原始数据模型图

来源:689_report.pptx,数据架构、SQL 及可视化展示。

06 / AI AGENTS

MIA 与自动化工作流

以 Telegram 为统一入口,连接语音转写、聊天模型、对话记忆与工具调用;另将职位筛选、文章制作和邮件提醒组织为独立工作流。

TelegramOpenAIRSSPerplexityClaude
01 MIA 个人助手

接收文本或语音消息,按消息类型分流;语音转写后进入 Tools Agent,连接日历、Gmail、新闻、摘要和行程规划工具,再通过 Telegram 返回结果。

02 职位筛选与求职信

使用 RSS 获取 LinkedIn 相关职位信息,根据经历和技能对机会进行评估、排序,达到设定条件时生成求职信草稿,供后续检查和修改。

03 文章初稿与 SEO 修订

Perplexity 搜集资料,Claude 撰写初稿,ChatGPT 提供 SEO 修改建议;结合初稿与建议形成修订版本。

04 学校邮件与待办提醒

识别学校邮件并判断是否需要采取进一步行动,对需要跟进的事项通过 Telegram 发出提醒。

WORKFLOW MAP

从一条消息到工具协作

  1. 输入:文本 / 语音
  2. 处理:消息分流与转写
  3. 协作:模型、记忆与工具
  4. 输出:结果与行动提醒

工作流图展示已配置的节点与连接,不代表各任务的成功率或节省工时。

07 / REWARD & PATH FINDING

贪吃蛇的奖励与路径迭代

从原地绕行、随机探索到自碰撞与保守路线:通过行为观察反推奖励设计和路径规划的问题。

Reward DesignExplorationShortest PathCollision Avoidance
  1. 食物奖励 + 触壁惩罚

    只在原地绕行,规避惩罚却没有有效觅食。

  2. 加入探索奖励

    开始在有限空间内移动,但路径仍较随机。

  3. 引入最短路径

    蛇身增长后仍会撞到自身,距离最短不等于路径安全。

  4. 优化避碰路线

    沿预设路线规避自身,代价是觅食路程更长。

LIVE STRATEGY DEMO

观察策略如何改变行为

蛇长3
步数0
食物0

这是用于解释行为差异的规则演示,不是原项目训练回放或性能对比。各策略从相同长度开始;暂停全站动效后仍可单步观察。

补充实践 · 字符串匹配算法

比较朴素匹配、Rabin–Karp、KMP、有限自动机与 Boyer–Moore 五类算法的匹配机制和理论复杂度,完成合作课程展示。

04 / CAPABILITIES

技能与语言

数据工程与 BI

SQL · ETL · Dimensional Modeling · SQL Server · pandas · Tableau

机器学习与视觉

NumPy · scikit-learn · TensorFlow / Keras · OpenCV · MobileNetV2 · LSTM

文本分析与智能体

TF-IDF · SVD · K-Means · LDA · NetworkX · Tools Agent · RSS

业务研究与表达

Excel · R · Stata · Wind · Markdown

语言能力

英语:GRE 328 · IELTS 6.5
粤语:母语

CONTACT

期待与你交流

关于数据、金融与下一次合作。

MIA 个人助手工作流

Expanded MIA workflow diagram