我最近一直在微信里跟着 AI 练 HYROX

date
Jul 30, 2026
slug
ai-training-assistant-long-term
status
Published
summary
我练 CrossFit 和 HYROX,为了备赛开始补跑步和心肺。把 Hermes 接进微信,用 Somvia 读取 Apple Health,再让 GPT-5.6 Sol 结合长期训练记录分析心率、睡眠、恢复和跑步表现。这套系统的关键并非生成一次课表,而是让同一个 AI 记得过去、看到真实数据,并持续根据新的训练结果修正判断。
tags
AI
AI Agent
Memory
type
Post
最近我多了个习惯:训练计划直接在微信里跟 AI 一起定。
我平时练 CrossFit 和 HYROX。CrossFit 就是在健身房里做各种高强度功能性训练,举重、体操、有氧混着来,每天的课表都不一样。HYROX 更像一场体能竞速赛:跑 8 个 1 公里,每跑完 1 公里接一个动作,雪橇推拉、划船、波比跳、农夫行走,全程不能停。这两个项目都很吃心肺和持续输出。
为了准备 HYROX 比赛,我开始补跑步和心肺,问题一下子就多了:20 分钟节奏跑到底怎么跑?HYROX 团课能不能代替间歇跑?昨天刚上完 Hyrox Complete,今天还能不能接着跑?准备测 5KM,第一公里该跑多快?
最近几个月,我练完都会打开微信,跟 AI 聊一会儿当天的训练。
有时候就是一句:「今天课上又被拉爆了」「昨天腿还挺酸,明天能不能跑间歇」,或者直接问它:「这周已经连着练了三天,周末还想去 Savage,你说怎么安排?」
一开始都是随手问问。后来我发现,单次问答根本做不了训练规划。每开一个新对话,都得从头解释我最近练了什么、哪天有空、之前哪儿疼、现在在备什么比赛。
我想要的是同一个 AI:它记得我之前的情况,还能根据新数据一直修正判断。

它得先慢慢了解我

用久了,AI 当然也会判断错。
有一次它把 Savage 当成了课程。我直接纠正:Savage 是我训练的健身房,Hyrox Complete 才是课。之后聊课表,它就没再把这俩搞混。
这事看着小,其实很能说明长期记忆的作用。
训练这件事,AI 真正需要记住的,远不止身高、体重、最大心率。它还得知道我平时练什么、固定课排在哪几天、最近在备哪场比赛、哪些训练容易连着上强度,以及它之前给过哪些不靠谱的建议。
比如我说「周末还想去 Savage」,只有它知道这是个场馆,才会接着问我打算上什么课。要是把 Savage 当成一门课,后面强度怎么判断肯定就偏了。
所以记忆的价值不只是少打几行字,它直接决定了 AI 能不能听懂你在说什么。

它看不到我身体发生了什么

但有个很麻烦的问题:AI 再聪明,也看不到躺在 Apple Health 里的数据。
我总不能每次都截图,手动告诉它昨晚睡了多久、HRV 多少、跑了几公里、平均心率多少。
而且训练数据也不是几个平均值能说清的。一场 HYROX 或者间歇跑,很多有用的东西都藏在过程里:心率从哪一段开始往上窜,组间有没有歇过来,每公里配速是不是一直在掉,步频和功率什么时候变了,中途停的时间有没有把平均值拉偏,还有练之前几天的睡眠和恢复怎么样。
所以我干脆做了个叫 Somvia 的东西,把 Apple Health 里的健康和训练数据整理成 AI 能直接查的结构,再通过 MCP 接进 Hermes。
接好之后,玩法一下子变多了。我不用一项项抄数据了,AI 能自己读一场比赛的心率曲线、每公里配速、间歇分段、步频、跑步功率、睡眠阶段、HRV、静息心率、VO₂ Max。
再往前看几周,它还能整理出一些过去通常要在专业跑表、恢复设备或者训练平台里才能看到的分析:最近高强度是不是太密了,跑量有没有真的涨上来,长距离从第几公里开始掉速,恢复变差是单日波动还是一直在往下走,现在的配速区间和成绩大概是什么水平。
不过这些原始数据还是来自 Apple Health。Somvia 负责整理和查询,阈值配速、Critical Speed、训练负荷、成绩预测这些,是模型基于已有数据推出来的,得继续拿真实训练校准,不能当成实验室测出来的结果。

记久了,判断会不一样

有一次我连着两天都在上强度。
第一天做了一次 HYROX 全程模拟,用时大概 1:37:30,平均心率接近 172,最高冲到 187。第二天又做了将近 1 小时 41 分钟的 Mixed Cardio,平均心率 160 左右。
我自己当时就觉得「这两天量还挺大」。
但 AI 往前翻了记录,发现我那段时间 13 天练了 12 天,好几节课最高心率都接近 180,就建议我别再往上堆了,至少留一个完整休息日。
如果只看当天,我还能继续练。把前后十几天放一起看,结论就变了。
测 5KM 时也遇到过类似的情况。
我 8×1KM 间歇,工作段平均能跑到 4:40/km 左右。单看这个,很容易给一个挺激进的预测。
但 AI 还查到两件事:一是我当时纯跑量其实不高,7 月折算下来一周也就 12.4km 左右;二是我有次连着跑前 3KM 用了约 15:36,后面明显掉速了。
把短间歇速度、持续跑能力和跑量底子放一起,它给的 5KM 预测是 24:30 到 25:30,建议先按 25 分钟来:第一公里压到 5:05,第二、三公里稳在 5:00,3KM 之后再按体感提。
这个判断跟我自己的感受很贴:短间歇速度有了,但连续顶住的能力还不够稳。第一公里跑嗨了,后面就容易还债。
长期数据的作用就在这儿——它会拉住模型,不让它被一次漂亮成绩带跑偏。

体感也是数据的一部分

Apple Health 能记心率和配速,却不知道我那天为什么跑得慢。
天太热、前一晚没睡好、课里休息偏多、动作不熟、腿有点不舒服,这些都会影响表现,但手表记不全,模型也不可能凭空知道。
所以我练完还是会补几句:
「今天体感其实不累。」
「这节课中间休息比较多。」
「心率偏高,可能跟天热有关。」
「右腿有点紧,但不疼。」
它也不会只认手表数据。AI 会把这些和设备数据放回去重新判断,我到底练了多少、第二天该怎么安排。Apple Health 不知道我今天想练什么,主观体感还是得自己补。
这也让我重新理解了健康数据:体感不是什么不可靠的附注,它本身就是训练上下文的一部分。设备数据和人自己的感觉,得互相校正。

核心的判断,我还是交给强模型

我这套配置是 Hermes 接 Codex,用 GPT-5.6 Sol,reasoning effort 开到 xhigh。Hermes 对我最大的好处就是能接微信,练完顺手聊两句就行,它的长期 Memory 和历史会话负责把这些零散交流接起来。
为什么选 Sol,原因很直接:训练分析很看模型够不够强。
它得同时懂运动生理、跑步训练、睡眠、恢复、伤病风险这些东西,还得把它们跟我几个月的训练记录揉在一起算。这里面既有计算,也有很多不完整、互相牵扯的信息。
现在很多小模型的 Agentic 能力做得很强,搜东西、调 API、制作 PPT 啥的,看起来很哇塞,靠给它喂工具调用的数据、做专项训练,很快就能补上来。这类任务通常边界清楚,结果也好验证:工具调没调成功、JSON 对不对、文件生成没有,都有明确答案。
但健康和训练分析经常没有唯一标准答案。同样的心率配速,还得看天气、睡眠、训练史、体感、设备误差。Agentic 跑分高,只能说明它擅长那一类任务,不能直接证明它的开放领域知识和复杂健康判断也一样强。
Sol 是 GPT-5.6 系列里最强的那个,官方定位就是处理复杂专业工作的旗舰。在更偏临床的 HealthBench Professional 里,Sol 也比同系列的 Terra 和 Luna 高。HealthBench 不能直接代表训练规划能力,但它至少说明一件事:处理复杂健康信息时,最强的模型确实有更大的余量。
xhigh 是给模型更多推理预算,让它能多花点时间查事实、找缺失信息、比较不同解释、看数据之间有没有矛盾。
我不是说它每次都对。但核心判断我还是愿意交给能力余量更大的模型,再把 reasoning effort 开到 xhigh,让它多检查几遍。
所以假如你也想用 AI 接管自己的训练,有条件的话我个人更推荐 ChatGPT 或 Claude。Gemini 全系列我强烈不推荐——至少在我自己的使用里,它的幻觉问题和复杂健康数据的稳定性远没有达到要求。国内的话,Kimi K3、Qwen 3.8 Max 我试过都还不错,其他的都比较一般。实测下来感觉还是跟参数量强相关。

说到底是在设计上下文

这套系统拆开看其实不复杂:
  • 微信是我平时说话的地方;
  • Hermes 记着长期背景、历史对话,负责调工具;
  • Somvia 把 Apple Health 的数据整理好给它查;
  • GPT-5.6 Sol 负责理解、计算、判断。
真正难的是决定什么东西该进 Prompt。
像我练 CrossFit 和 HYROX、Savage 是场馆、固定怎么排课,这种长期不变的,适合放进长期记忆。
每天在变的心率、睡眠、HRV、训练记录,适合需要的时候再通过 Somvia 查。
「今天不累」「右腿有点紧」这种体感,得带着时间和场景存,不能直接焊死成长期结论。
阈值配速、成绩预测、恢复判断这些推出来的结果,要标清楚依据和时间,后面的训练数据能更新甚至推翻它。
要是把所有历史都塞进 Prompt,上下文很快就被污染了;可只留几个固定标签,AI 又看不懂现在的状态。长期训练助理干的活,就是一直在挑「此刻真正有用的那部分信息」。
所以它说到底是个上下文设计问题。

它也有边界

我不会让 AI 替医生或教练做决定。
手表和 Apple Health 的数据可能缺、可能有误差,模型推出来的阈值配速、恢复状态、成绩预测,都得靠真实训练一次次验证。
真出现持续疼痛、胸痛、头晕、心悸、心率异常,就该停训去看专业的人。AI 在这儿顶多帮我整理信息、发现异常趋势,诊断它做不了。
我更愿意把它当一个一直在旁边参与我训练决策的助理:整理记录、发现矛盾、算配速,提醒我别忘了前几天发生过什么。最后练不练、练多少,还是我自己定。

从聊天工具到训练助理

现在我流程很简单。
练完就在微信里说一嘴:今天练了什么、体感咋样、哪儿不舒服。AI 自己去查 Apple Health 的心率、配速、睡眠、恢复,再结合前几周的记录,判断这次到底练到什么程度,第二天该上强度还是收一点。
一次新的 5KM 测试,也不是测完就完了。真实成绩会被放回之前的间歇、周跑量、后程掉速里,重新校准配速区间和下一阶段怎么练。
每多练一次,后面判断的依据就多一块真实信息。
我现在觉得,AI 帮你规划训练,关键就在这儿:它得长期记得你怎么练的,看得到身体真的发生了什么,模型本身还得有能力把这些信息串起来。
Hermes 记着训练背景,Somvia 接进 Apple Health 数据,GPT-5.6 Sol 负责理解和判断。这三样接起来之后,我在微信里随手说的那几句话,才慢慢变成一套一直跟着我更新的训练计划。
对我来说,这才是 AI 从一个聊天工具,变成我长期训练助理的那一刻。