为什么我们公开 benchmark
"比 Otter 准确率高"是口号。可复现的 fixture + 公开测试脚本才是数据。本页每月更新一次,所有 fixture 与脚本可在 GitHub 仓库 crossmeet/benchmarks(开仓中)下载复跑。
当前状态:测试 fixture 与脚本工程化中。下方表格数据标 TBD · 测试中 表示我们诚实地选择"数字未就绪",而不是为了好看的对比表先写假数字。完成后会公开 PR diff,让你看到每个数字怎么来的。
测试设置
| 项目 | 内容 |
|---|---|
| Fixture | BBC / NPR / TED 公开演讲 + 真实跨境会议录音(已脱敏) · 约 30 分钟混合内容 |
| 指标 | WER(Word Error Rate,越低越好)· BLEU(机器翻译质量,越高越好)· 首屏延迟(ASR 第一个字到屏幕的时间) |
| 横向对手 | CrossMeet(多引擎组合)· Otter.ai Pro · JotMe Pro · OpenAI Whisper API 直跑 · 阿里 Qwen3-ASR |
| 测试环境 | Windows 11 · RTX 4070 12GB · 100Mbps 网络 |
| 更新频率 | 月度 |
EN → ZH 同传
| 工具 | WER ↓ | BLEU ↑ | 首屏延迟 ↓ |
|---|---|---|---|
| CrossMeet · Whisper-faster + Claude 3.7 | TBD · 测试中 | TBD · 测试中 | ~100ms |
| CrossMeet · Qwen3-ASR + GPT-4 | TBD · 测试中 | TBD · 测试中 | TBD |
| Otter.ai Pro | N/A(仅转录,无翻译) | N/A | TBD |
| JotMe Pro | TBD | TBD | TBD |
| Whisper API 直跑(无后处理) | TBD | N/A | TBD |
ZH → EN 同传
| 工具 | WER ↓ | BLEU ↑ | 首屏延迟 ↓ |
|---|---|---|---|
| CrossMeet · 阿里 ASR + Claude 3.7 | TBD · 测试中 | TBD · 测试中 | TBD |
| CrossMeet · Qwen3-ASR + GPT-4 | TBD · 测试中 | TBD · 测试中 | TBD |
| Otter.ai Pro | × 不支持 ZH 转录 | × | × |
| JotMe Pro | TBD | TBD | TBD |
常见语言对覆盖
数据来源:各厂商公开文档 · 2026-05 · 仅事实陈述。
| 语言对 | CrossMeet | Otter | JotMe | Wordly |
|---|---|---|---|---|
| EN ↔ ZH | √ | × | √ | √ |
| EN ↔ JA | √ | × | √ | √ |
| EN ↔ KO | √ | × | √ | √ |
| EN ↔ DE | √ | × | √ | √ |
| EN ↔ FR | √ | √ | √ | √ |
| EN ↔ ES | √ | √ | √ | √ |
| EN ↔ RU | √ | × | × | √ |
| EN ↔ AR | √ | × | × | √ |
| EN ↔ PT | √ | × | √ | √ |
| EN ↔ IT | √ | × | √ | √ |
方法论 · 反向验证
有人会问:"你自己写自己赢,公平吗?"
答:fixture + 脚本都在 GitHub 公开,你可以自己跑。我们也欢迎竞品方提交 PR 补充他们的测试数据 — 真实数据没人喷,假数据藏不住。
每月 release 一份测试报告(PR diff 形式),让审计可读。
限制
- 当前 fixture 偏向商务对话场景。文学翻译、诗歌、法律文本未覆盖。
- 仅测试 Windows 平台。macOS / Linux 后续补。
- 不测试硬件极差场景(旧 CPU / 无 GPU 时本地引擎速度会显著下降)。
- 不测试网络极差场景(云引擎依赖网络)。
GitHub 仓库
- 测试脚本与 fixture:github.com/crossmeet/benchmarks(占位 · 开仓中)
- 每月发布的对比报告会以 markdown 形式归档在
reports/<YYYY-MM>.md,可订阅仓库。
如有指标建议、希望覆盖的语言对、或想贡献 fixture,请联系 research@crossmeet.com。