11款大模型中译英能力全方位横评:学术论文翻译与LaTeX排版实战对比
由于导师认为我的论文中文稿已基本完善,我开始着手将其翻译成英文。但自身英语水平有限,决定直接让大模型处理LaTeX源文件完成翻译。我使用了如下提示词:
# Role作为一位兼具顶尖科研写作专家与资深会议审稿人(ICML/ICLR 等)双重身份的助手。学术品味极高,对逻辑漏洞和语言瑕疵零容忍。
# Task处理来自@E:/paper_cn_final/ 里面的中文论文初稿,将其翻译并润色为完整的英文论文。
# Constraints1. 视觉与排版: - 尽量不要使用加粗、斜体或引号,这会影响论文观感。 - 尽可能与原论文源码保持一致,不要自作主张添加无意义的格式修饰。
2. 风格与逻辑: - 要求逻辑严谨,用词准确,表达凝练连贯,尽量使用常见的单词,避免生僻词。 - 尽量不要使用破折号(—),推荐使用从句或同位语替代。 - 尽可能少地使用\item列表,必须使用连贯的段落表达。 - 去除“AI味”,行文自然流畅,避免机械的连接词堆砌。 - 术语前后保持一致。 - 与中文原稿的表述严格一致,不允许擅自更改叙事与逻辑。 - 如果遇到不理解的中文名词或表述,去看项目的源码理解并固定翻译。
3. 时态规范: - 统一使用一般现在时描述方法、架构和实验结论。 - 仅在明确提及特定历史事件时使用过去时。
4. 输出格式: - Part 1 [LaTeX]:只输出翻译成英文后的内容本身(LaTeX 格式)。 * 语言要求:必须是全英文。 * 特别注意:必须对特殊字符进行转义(例如:将 `95%` 转义为 `95\%`,`model_v1` 转义为 `model\_v1`,`R&D` 转义为 `R\&D`)。 * 保持数学公式原样(保留 $ 符号)。 - Part 2 [Translation]:对应的中文直译(用于核对逻辑是否符合原意)。 - 除以上两部分外,不要输出任何多余的对话或解释。
# Execution Protocol在输出最终结果前,请务必开个子代理(subagent)进行自我审查:1. 审稿人视角:假设你是最挑剔的 Reviewer,检查是否存在过度排版、逻辑跳跃或未翻译的中文。2. 立即纠正:针对发现的问题进行修改,确保最终输出的内容严谨、纯净且完全英文化。3. 查看与中文原稿的表述是否严格一致,不允许擅自更改叙事与逻辑。
测评模型列表
本次共选取了11个当前最新的大模型进行文献翻译,具体为:gpt-5.5、claude-opus-4.8、Doubao-Seed-2.0-Code、deepseek-v4-pro、deepseek-v4-flash、Gemini-3.5-flash、GLM-5.1、kimi-k2.5、mimo-v2.5pro、minimax-m3、qwen-3.7max。
评分规则:
- 裁判模型为gpt-5.5。
- 每个模型的翻译结果均独立评分三次,取平均值作为最终成绩。
实验环境:
- 主要的代码助手采用了snow cli的ultra todo模式;只有Doubao-Seed-2.0-Code在trea中运行。
- 除豆包以外,其余模型均通过能保证满血的API接入snow调用。
- 凡可设置推理强度的,均调至最高。
测试结果(含LaTeX编译符合度评分):
由于任务要求不仅翻译质量要高,还必须正确使用LaTeX语法,输出能直接编译的源码,因此测评维度同时涵盖翻译质量和LaTeX使用能力。
总分排名
| 排名 | 模型 | 第1次 | 第2次 | 第3次 | 平均分 / 92 |
|---|---|---|---|---|---|
| 1 | deepseek-v4-pro | 80 | 80 | 80 | 80.00 |
| 2 | claude-opus4.8 | 79 | 80 | 79 | 79.33 |
| 3 | mimo-v2.5pro | 80 | 79 | 78 | 79.00 |
| 4 | deepseek-v4-flash | 77 | 79 | 80 | 78.67 |
| 5 | minimax-m3 | 79 | 78 | 78 | 78.33 |
| 6 | qwen-3.7-max | 78 | 79 | 77 | 78.00 |
| 7 | gpt5.5 | 79 | 77 | 76 | 77.33 |
| 8 | glm-5.1 | 76 | 78 | 73 | 75.67 |
| 9 | gemini-3.5flash | 76 | 74 | 76 | 75.33 |
| 10 | kimi-k2.6 | 77 | 76 | 71 | 74.67 |
| 11 | doubao-2.0-code | 61 | 71 | 65 | 65.67 |
各能力维度平均分
| 模型 | 平均总分 / 92 | 内容忠实与逻辑一致 /25 | 术语准确与一致 /18 | 英文准确与简洁 /17 | 学术风格与自然度 /12 | 时态与论文叙述 /8 | LaTeX与源码一致 /12 |
|---|---|---|---|---|---|---|---|
| deepseek-v4-pro | 80.00 | 23.00 | 15.00 | 14.00 | 10.00 | 8.00 | 10.00 |
| claude-opus4.8 | 79.33 | 23.00 | 15.00 | 14.00 | 10.00 | 7.67 | 9.67 |
| mimo-v2.5pro | 79.00 | 22.33 | 14.67 | 14.00 | 10.00 | 8.00 | 10.00 |
| deepseek-v4-flash | 78.67 | 23.00 | 15.00 | 14.33 | 10.00 | 7.33 | 9.00 |
| minimax-m3 | 78.33 | 23.00 | 15.00 | 14.00 | 10.00 | 7.33 | 9.00 |
| qwen-3.7-max | 78.00 | 21.67 | 14.00 | 14.33 | 10.00 | 8.00 | 10.00 |
| gpt5.5 | 77.33 | 21.33 | 15.00 | 14.00 | 10.00 | 7.67 | 9.33 |
| glm-5.1 | 75.67 | 21.33 | 14.33 | 13.67 | 9.67 | 7.67 | 9.00 |
| gemini-3.5flash | 75.33 | 21.33 | 14.00 | 13.00 | 9.00 | 7.67 | 10.33 |
| kimi-k2.6 | 74.67 | 22.33 | 14.00 | 13.00 | 9.00 | 8.00 | 10.00 |
| doubao-2.0-code | 65.67 | 16.33 | 14.00 | 12.33 | 8.33 | 7.33 | 7.33 |
多数结果与大家普遍认知吻合:DeepSeek和Claude的语言能力依旧十分强劲。但DeepSeek成本极低,整篇论文翻译仅需几毛钱。豆包的能力明显偏低,可能源于模型自身限制或工具链影响。较为意外的是mimo和minimax跻身前列,部分国产模型甚至排在gpt之前,不过gpt5.5自身也调整了输出风格,或许不算奇怪。除末尾几名外,前几位得分其实相当接近,T1梯队基本由DeepSeek、Claude和Mimo组成。
为了更清晰地观察纯翻译能力,我们剔除了LaTeX相关维度,对纯文本翻译效果进行再排名:
总分排名(不含LaTeX)
| 排名 | 模型 | 第1次 | 第2次 | 第3次 | 平均分 / 80 | 排名变化 |
|---|---|---|---|---|---|---|
| 1 | deepseek-v4-pro | 70 | 70 | 70 | 70.00 | — |
| 2 | claude-opus4.8 | 69 | 70 | 70 | 69.67 | — |
| 3 | deepseek-v4-flash | 69 | 69 | 71 | 69.67 | ↑1 |
| 4 | minimax-m3 | 70 | 69 | 69 | 69.33 | ↑1 |
| 5 | mimo-v2.5pro | 70 | 69 | 68 | 69.00 | ↓2 |
| 6 | gpt5.5 | 69 | 68 | 67 | 68.00 | ↑1 |
| 7 | qwen-3.7-max | 68 | 69 | 67 | 68.00 | ↓1 |
| 8 | glm-5.1 | 67 | 68 | 65 | 66.67 | — |
| 9 | gemini-3.5flash | 65 | 64 | 66 | 65.00 | — |
| 10 | kimi-k2.6 | 67 | 66 | 61 | 64.67 | — |
| 11 | doubao-2.0-code | 56 | 62 | 57 | 58.33 | — |
各能力维度平均分(翻译项)
| 模型 | 平均总分 / 80 | 内容忠实与逻辑一致 /25 | 术语准确与一致 /18 | 英文准确与简洁 /17 | 学术风格与自然度 /12 | 时态与论文叙述 /8 |
|---|---|---|---|---|---|---|
| deepseek-v4-pro | 70.00 | 23.00 | 15.00 | 14.00 | 10.00 | 8.00 |
| claude-opus4.8 | 69.67 | 23.00 | 15.00 | 14.00 | 10.00 | 7.67 |
| deepseek-v4-flash | 69.67 | 23.00 | 15.00 | 14.33 | 10.00 | 7.33 |
| minimax-m3 | 69.33 | 23.00 | 15.00 | 14.00 | 10.00 | 7.33 |
| mimo-v2.5pro | 69.00 | 22.33 | 14.67 | 14.00 | 10.00 | 8.00 |
| gpt5.5 | 68.00 | 21.33 | 15.00 | 14.00 | 10.00 | 7.67 |
| qwen-3.7-max | 68.00 | 21.67 | 14.00 | 14.33 | 10.00 | 8.00 |
| glm-5.1 | 66.67 | 21.33 | 14.33 | 13.67 | 9.67 | 7.67 |
| gemini-3.5flash | 65.00 | 21.33 | 14.00 | 13.00 | 9.00 | 7.67 |
| kimi-k2.6 | 64.67 | 22.33 | 14.00 | 13.00 | 9.00 | 8.00 |
| doubao-2.0-code | 58.33 | 16.33 | 14.00 | 12.33 | 8.33 | 7.33 |
若您可自行调整LaTeX格式,或仅关注翻译水平,那么这份纯翻译排名更能反映模型真实的语言驾驭能力。
写在最后
在测试过程中,kimi和minimax均出现过几次死循环,不过我还是给予了重新生成的机会,这或许对其他模型稍有不利;严格来说,出现死循环时可以给零分,但本次测试的核心仍是翻译,所以还是希望它们能给出完整结果。
如果条件允许,让每个模型翻译多次并让多位裁判评分会更加严谨,不过受精力所限,目前只能呈现这样一个相对简易的对比。因此本次结果更多是提供一个轻松参考,也希望能对有类似需求的读者有所帮助。