我是虎臻,AI 算法工程师,关注 LLM 训练与后训练(RLHF / GRPO)、强化学习、Agent 与世界模型。这里记录我的学习笔记与思考。
📧 邮箱:youhuzhen@gmail.com
🐙 GitHub:github.com/HuzhenYou
欢迎在文章下方留言,或邮件交流。