从 Thought、Action、Observation 的数据流出发,用 Python 实现一个最小的 ReAct 风格 Wikipedia Agent。
Recent Posts
学习过程 从CLIP讲到VLA
从零实现 micrograd 风格的 autograd,建立对反向传播机制的直观理解
一些常见的pytorch的用法
PPO损失函数的推导与理解
基于 nanogpt 的 transformer 复习
一些做题时候容易忘记/重要的trick
梳理 State、Observation、Return、Value Function、MDP、Bellman 方程,以及 DP、MC、TD 的核心区别。
关于TD,PG的一些推导