Skip to content

个人简介


基本信息

姓名: 吴海明(Wu, Haiming) [Engliash CV]
手机: (+86)-18520460959
Email: hm.wu.edu@gmail.com

新消息

  • 好消息!我们提出的双向交互(Bi-DCSpell)纠错框架被EMNLP2024接收 [pdf].
  • 我们提出的基于RMT框架的非侵入式可控文本生成方法被ACL2024接收 [pdf].
  • 本人在北京智源人工智能研究院的智能评测组深度参与大型语言模型 Aquila(飞鹰)和评测体系 FlagEval(天秤)的开发,目前我们已经开源 Aquila 系列模型和 FlagEval 大型预训练模型平台,更多信息可以查看智源研究院官方公众号文章.
  • 本人和两位实力强劲的实验室成员(贾奥、李泽林)一起参与了 NLPCC2023-share-task 的 汉语拼写纠错(task8)汉语语法纠错(task1) 两个学术评测任务,并分别取得了第4名和第5名的好成绩! 更多详细信息可以查看官方链接:任务说明, task1, task8.

学习经历

时间段 学校 专业 指导老师 学习阶段
2020.09 - Now 北京理工大学 计算机科学(工程学位) 宋大为老师 博士
2019.09 - 2020.03 蒙特利尔大学 聂剑云老师团队 聂剑云老师 访问
2018.09 - 2019.03 西湖大学 张岳老师团队 张岳老师 访问
2017.09 - 2020.07 华南师范大学 电路与系统 薛云老师 硕士
2013.09 - 2017.07 长江大学 信息与计算科学 - 本科

实习经历

2023.02 - now 北京智源人工智能研究院-智能评测组 算法工程师(实习生)

  • 构建LLM自动化客观评测平台
  • 开发LLM主观评测系统,用于支撑Aquila模型各训练阶段的性能评测
  • 设计主观评测体系,包括通用能力评测、代码评测、生成能力评测等

2021.03 - 2022.10 华为技术有限公司-终端云服务部 算法工程师(实习生)

  • Petal Search用户意图认知模块,挖掘用户搜索意图
  • 开发会话情感分析模块,用于支撑对话搜索
  • 开发汉语query纠错服务的算法,包括基于BERT、T5等方法的微调和纠错预训练

项目经历

2023.02 - 2023.05 FlagEval评测系统

  • 客观评测:针对大型语言模型的预训练、SFT等各个阶段的性能评估问题,构建便于自动化评测的评测系统
  • 主观评测:针对大型语言模型的对话能力,构建主观评测系统,包括主观评测集、标注流程和所有可能的自动化流程
  • “能力-任务-指标”评测体系,为了挖掘大型语言模型的各项能力,构建以能力为核心的三维评测体系

2021.03 - 2021.09 面向搜索query的意图模块

  • 针对意图识别和槽位任务潜在的有益特征,构建基于意图分类和槽位填充的联合模型;
  • 设计 Cross-Attention 特征迁移学习模块,分别让意图和槽位的特征在对方的特征表示空间内选择对自身任务有用的信息;
  • 相关技术:PyTorch,Transformer

2022.01 - 2022.10 汉语query纠错服务

  • 构建以预训练模型为核心的汉语文本纠错模型,使用BERT为输入query生成纠错候选;
  • 为了加快推理速度并提高精度,采用标题数据二次训练TinyBert,并用于query纠错;
  • 为提高召回效果,采用负样本对数据训练纠错模型,让模型更多关注纠错特性;
  • 相关技术:PyTorch,Transformer

科研成果

论文

  • Bi-DCSpell: A Bi-directional Detector-Corrector Interactive Framework for Chinese Spelling Check. Wu, Haiming, Hanqing Zhang, Richeng Xuan, and Dawei Song. In Findings of the Association for Computational Linguistics: EMNLP 2024, pages 3974–3984, Miami, Florida, USA. Association for Computational Linguistics. [PDF]
  • Controllable Text Generation with Residual Memory Transformer. Hanqing Zhang, Si Sun, Haiming Wu, Dawei Song. In Findings of the Association for Computational Linguistics: ACL 2024, pages 1048–1066, Bangkok, Thailand. Association for Computational Linguistics. [PDF], [code]
  • Prototype-based Prompt-Instance Interaction with Causal Intervention for Few-shot Event Detection[C]. Jingyao Tang, Lishuang Li, Hongbin Lu, Xueyang Qin, Beibei Zhang, Haiming Wu. Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024). 2024: 13269-13278. [PDF]
  • Improving long-tail relation extraction via adaptive adjustment and causal inference. Tang, Jingyao, Lishuang Li, Hongbin Lu, Beibei Zhang, and Haiming Wu. Neurocomputing (2023): 126563. [PDF], [BIB]
  • Shared-private LSTM for Multi-domain Text Classification. Haiming Wu, Yue Zhang, Xi Jin, Yun Xue and Ziwen Wang. In Proceedings of the 8th CCF International Conference on Natural Language Processing and Chinese Computing (NLPCC2019), Kunming, China, October. [PDF], [Code], [BIB]
  • Bert-Pair-Networks for Sentiment Classification. Ziwen Wang, Haiming Wu, Han Liu, Qian-Hua Cai. International Conference on Machine Learning and Cybernetics (ICMLC), pp. 273-278. IEEE, 2020. [paper], [BIB]
  • Semi-Supervised Sentiment Classification on E-Commerce Reviews Using Tripartite Graph and Clustering. Xin Lu, Donghong Gu, Haolan Zhang, Zhengxin Song, Qianhua Cai, Hongya Zhao, Haiming Wu. International Journal of Data Warehousing and Mining (IJDWM) 18, no. 1 (2022): 1-20. PDF, [BIB]
  • Granular computing-based multi-level interactive attention networks for targeted sentiment analysis. Haihui Li, Ting Yuan, Haiming Wu, Yun Xue, Xiaohui Hu. Granular Computing 5, no. 3 (2020): 387-395. [PDF], [BIB]
  • Composite simpson method based on differential evolution algorithm for numerical integral. Qian Li, Yongqiang Mou, Junxia Guan, Qinghua Su, Beiping Wu, Haiming Wu. 12th International Conference on Natural Computation, Fuzzy Systems and Knowledge Discovery (ICNC-FSKD), pp. 777-781. IEEE, 2016. [BIB]

专利

  • 基于拼写检查的中文文本纠正方法、装置以及计算机设备 – (2024.09~2024.10) (已受理)
  • 基于相似度驱动的文本纠正方法、装置以及计算机设备 – (2023.10~2023.11) (已受理)
  • 文本纠正方法、装置、电子设备以及存储介质 – (2023.07~2023.08) (已受理)
  • 一种纠错指导的方法及相关装置 –(2022.06~2022.07)(已受理)
  • 一种提取物品描述信息的方法和电子设备 –(2022.07~2022.08)(已受理)
  • 基于三部图和聚类分析的半监督电商评论情感分析方法 – (2018.6~2018.10)(已授权)
  • 基于点互信息的词向量模型和基于CNN的文本分类方法 – (2018.02~2018.06)(已授权)
  • 一种窃电检测方法及系统 –(2017.10~2018.03)(已授权)

竞赛情况

  • (本科)美国大学生数学建模竞赛 – 2016年美国大学生数学建模竞赛 – Meritorious Winner
  • (本科)全国大学生数学建模竞赛 – 2015年全国大学生高教社杯数学建模竞赛 – 本科组全国二等奖
  • (本科)数据挖掘竞赛 – 2016年泰迪杯全国大学生数据挖掘竞赛 – 全国三等奖
  • (本科)数据挖掘竞赛 – 2015年泰迪杯全国大学生数据挖掘竞赛 – 全国一等奖