Macaron V1 开源模型深度体验:用 LoRA 破解大模型「能力干扰」,打造个人 Agent 的实战利器
近期 Kimi K3 暂停了订阅服务,GLM 5.2 很难抢到,海外模型又面临封号风险——但选择远不止这些。我最近就在试用 Mind Lab 刚刚推出的 Macaron V1,一款专为个人 Agent 场景设计的开源模型。
新模型一发布,大家通常先看排行榜、价格和参数量,而我更关心它真实的编程与 Agent 能力。Mind Lab 把这条技术路线总结为“适应”与“协作”:先通过 LoRA 为不同能力留出相对独立的训练空间,再用强化学习持续优化,最后由基础设施和 Harness 将这些能力输送到真实任务中。Macaron V1 值得一聊的地方,正在于这几个环节已经串联成一套可以实战的模型系统。
这样讲可能还有点抽象。简单来说,Macaron V1 是心洲科技旗下 Mind Lab 面向个人 Agent 场景发布的开源模型,包含 Venti 与 Tall 两个版本:
Venti 共 748B 参数,由 744B 基础模型和四个 1B LoRA 组成,基座采用 GLM-5.2,原生支持 2M 上下文; Tall 为 35B,基于 Qwen3.6 进行后训练,面向本地部署。
一个大版本偏重前沿能力,一个小版本适合本地运行,在 Mac 上就能跑。参数规模大家都看得懂,但 Venti 真正值得关注的,是 744B 基座之外的那四个 LoRA。它们决定了 Macaron V1 如何组织不同能力,也引出了一个核心问题:为什么要将能力拆开训练,又怎样避免它们互相干扰?要回答这个问题,得先从 LoRA 说起。
1
LoRA 是 Low-Rank Adaptation 的缩写,中文通常译为“低秩适配”。
可以这样理解:一个大模型拥有数千亿参数,想让它掌握新技能,直接重新训练所有参数成本极高。LoRA 的做法是冻结原来的大模型,只在部分网络层旁边添加一组很小的可训练参数。训练时只更新这些小模块,就能调整模型行为。也就是说:
基础模型提供通用的知识和推理能力; LoRA 是装在基础模型上的“技能插件”; 不同 LoRA 可以分别负责聊天、编程、工具调用、界面生成等任务。它的优势包括训练成本低、文件较小、容易切换和回滚,还能在同一个基础模型上挂载多个专业版本。
Macaron V1 用了四个 LoRA,解决大模型后训练中的“能力干扰”。
在后训练阶段,如果把聊天、工具调用、编程和界面生成的数据混在一起训练同一组参数,不同任务的优化方向很容易发生冲突。例如:
聊天希望语言自然、有弹性; 编程要求语法严格、输出精确; Agent 强调规划与工具调用; GenUI 需要生成结构完整的交互界面。
当这些能力共同修改一套参数时,增强编程能力可能让聊天变得生硬;强化自由对话又可能降低代码输出的稳定性。这就是所谓的“互相打架”。
Macaron V1 的策略是将这四类能力分别放进四个 LoRA:
L0:Chat L1:Agent L2:Coding L3:GenUI
基础模型负责共享知识和推理能力,每个 LoRA 则在相对独立的参数空间中优化自己的专项能力。收到新请求后,L0 会判断任务类型并将请求路由到合适的 LoRA。这样既减少了不同任务在训练时的相互干扰,也便于单独升级、评测和回滚某项能力。
过去,人们通常只把 LoRA 视为一种节省训练成本的微调方法。Mind Lab 更看重它的另一层价值:让一个很小的模块长期保存模型在特定场景中形成的偏好、技能和工具使用习惯,而基础模型继续提供通用的知识和能力。
研究显示,用 LoRA 进行强化学习,算力和通信开销大约只有全参数训练的十分之一;即使把模块压缩到每层只调整一个方向,它仍然能够稳定学习。正因为模块足够小,每项能力都可以单独训练、测试、上线、回滚,也可以与其他能力灵活组合。

MoE、Skills 与 MoL 三种能力扩展路径
2
今天的 Agent 已经高度依赖 Memory、RAG、Skill 和 Harness。这些方法的共同特点是:经验保存在模型外部,需要使用时再放入上下文,让模型重新阅读。它们更新快,也适合保存事实、规则和操作流程,但随着内容不断积累,上下文会越来越长,信息冲突和维护成本也随之升高。模型读过一段历史,并不意味着它真正学会了其中反复出现的规律;参数学习则更进一步,把经过验证的经验写入可训练状态,让新的行为成为模型下一次工作的起点。
我更愿意把这两条路径理解为不同时间尺度的记忆。临时信息放进上下文,常用事实交给 Memory 和 RAG,逐渐稳定的行为习惯写入 LoRA,经过长期验证的通用能力再回到基础模型。这样的分层既能控制学习和更新成本,也为评估与回滚留出了空间。
对于长期维护同一个代码库的 Coding Agent 来说,这种方式比不断堆积上下文更具吸引力。
当 LoRA 可以被低成本地复制、训练和组合,增加模型数量本身也会成为提升能力的途径。在一组控制实验中,Qwen3-30B 的单个 Adapter 在 AIME24 上的准确率为 36.44%;让 198 个拥有不同学习经历的 Adapter 分别作答,再进行多数投票,准确率提升到 48.67%。相比之下,对同一个 Adapter 重复采样,最高只能达到 43.78%。这说明不同的训练经历能够形成互补能力,而 MoL 可以通过路由选择合适的专家,让“这项任务交给谁”也变成推理过程的一部分。

不同学习轨迹的 adapter 协作随模型数量扩展
3
这种技术选型真正困难的部分在基础设施。
在 30B 模型上进行强化学习,就已经需要很强的工程能力;当模型扩大到千亿参数级的 MoE 架构,训练难度还会显著上升。训练和推理在数值精度或执行路径上稍有偏差,奖励信号和生成结果就可能发生漂移,最终导致训练难以收敛。模型被拆分到多张 GPU 后,还必须保证各个切片之间的通信、计算和状态同步始终一致。
Macaron V1-Venti 的意义,正在于它把 LoRA 强化学习带到了 748B 的规模。 做过模型研发的同学应该能体会到,这一点非常了不起。
MinT 就是支撑这件事的后训练基础设施,也是核心竞争力的所在。 在这套系统中,负责生成训练经验的 Actor 与负责更新模型的 Learner 之间,只需要传递轻量的 Adapter,无需反复搬运完整的模型权重。系统可以统一管理上百万个拥有独立身份和版本记录的 LoRA,并支持最高万亿参数规模模型的训练与部署。当模型版本、GPU 集群和分布式训练被纳入同一套管理体系,一个共享基座上就可以运行大量不同的个性化状态,LoRA 也由此从一种实验性的训练方法,走向可以长期运行的服务能力。

MinT 连接用户可控训练与底层分布式基础设施
长上下文强化学习是另一块硬骨头。传统强化学习需要保留训练过程中的大量中间结果,还要对同一个提示词生成多个回复、计算奖励并更新参数,因此模型在推理时能读完一百万 Token,并不意味着训练时也能处理同样长的内容。
Mind Lab 为“超长上下文强化学习”设计了一套训练方法和执行系统,名为 LongStraw。在 8 张 H20 GPU 上,这套方法把 Qwen3.6-27B 的 GRPO 训练长度推进到 210 万 Token,也为 Macaron V1 的 2M 长上下文提供了后训练层面的支撑。
4
仔细看过 Mind Lab 的技术说明之后,会发现 Macaron V1 还有一处容易被忽略的设计:Harness 与模型是一起训练的。
模型训练时使用的工作环境,会尽量与上线后的真实环境保持一致。如果把模型看作“大脑”,Harness 就是它调用工具、保存状态和完成任务的“工作台”。UI4A 让模型通过代码把回答变成可交互的页面;REPL Harness 则允许模型把已经验证过的代码保存为工具,以后遇到类似任务时直接复用。HCP 负责统一管理运行过程中需要的规则、技能和模型配置,MindForge 再把这套工作台带入强化学习。这样一来,模型在训练中学会的工具和工作方式,到了真实产品中依然可以使用,从而减少“实验环境表现很好,上线后却无法正常工作”的问题。
模型在各个领域基准线上的成绩也十分亮眼。

5
目前 MinT 官方 API 已经上线。我这周就在用 Claude Code + Macaron-V1-Coding-Venti 做功能开发,官方提供了 CC Switch 的配置,可以一键导入:

配置完成后打开 CC,模型已经就位:

我用 Coding Venti 实现了 CatReader 智能翻译里的一个功能——默认显示翻译好的译文:

速度很快,完成度也相当不错。
使用过程中,我还在 CC 里安装了他家的插件 Macaron Artifacts,启动后访问 http://localhost:7878,界面如下:

通过这套 WebUI,我们可以观察模型和项目的运行状态,也可以直接在这套控制台里执行任务,使用起来相当方便。
Macaron V1 为我们打开了一个新的视野,它把个人 Agent 最难的几个问题都给出了明确的解法:经验如何形成学习信号,如何用轻量参数吸收经验,如何让大量专家共存协作,又如何让训练条件贴近真实运行环境。这条路现在已经从论文概念走到模型、基础设施和开发工具。
对于关心 Agent 未来发展的朋友来说,Macaron V1 绝对值得上手一试。