准确率公开对比

准确率公开对比

「比 Otter 准确率高」是口号。可复现的 fixture + 公开测试脚本才是数据。

为什么我们公开 benchmark

"比 Otter 准确率高"是口号。可复现的 fixture + 公开测试脚本才是数据。本页每月更新一次,所有 fixture 与脚本可在 GitHub 仓库 crossmeet/benchmarks(开仓中)下载复跑。

当前状态:测试 fixture 与脚本工程化中。下方表格数据标 TBD · 测试中 表示我们诚实地选择"数字未就绪",而不是为了好看的对比表先写假数字。完成后会公开 PR diff,让你看到每个数字怎么来的。

测试设置

项目 内容
Fixture BBC / NPR / TED 公开演讲 + 真实跨境会议录音(已脱敏) · 约 30 分钟混合内容
指标 WER(Word Error Rate,越低越好)· BLEU(机器翻译质量,越高越好)· 首屏延迟(ASR 第一个字到屏幕的时间)
横向对手 CrossMeet(多引擎组合)· Otter.ai Pro · JotMe Pro · OpenAI Whisper API 直跑 · 阿里 Qwen3-ASR
测试环境 Windows 11 · RTX 4070 12GB · 100Mbps 网络
更新频率 月度

EN → ZH 同传

工具 WER ↓ BLEU ↑ 首屏延迟 ↓
CrossMeet · Whisper-faster + Claude 3.7 TBD · 测试中 TBD · 测试中 ~100ms
CrossMeet · Qwen3-ASR + GPT-4 TBD · 测试中 TBD · 测试中 TBD
Otter.ai Pro N/A(仅转录,无翻译) N/A TBD
JotMe Pro TBD TBD TBD
Whisper API 直跑(无后处理) TBD N/A TBD

ZH → EN 同传

工具 WER ↓ BLEU ↑ 首屏延迟 ↓
CrossMeet · 阿里 ASR + Claude 3.7 TBD · 测试中 TBD · 测试中 TBD
CrossMeet · Qwen3-ASR + GPT-4 TBD · 测试中 TBD · 测试中 TBD
Otter.ai Pro × 不支持 ZH 转录 × ×
JotMe Pro TBD TBD TBD

常见语言对覆盖

数据来源:各厂商公开文档 · 2026-05 · 仅事实陈述。

语言对 CrossMeet Otter JotMe Wordly
EN ↔ ZH ×
EN ↔ JA ×
EN ↔ KO ×
EN ↔ DE ×
EN ↔ FR
EN ↔ ES
EN ↔ RU × ×
EN ↔ AR × ×
EN ↔ PT ×
EN ↔ IT ×

方法论 · 反向验证

有人会问:"你自己写自己赢,公平吗?"

答:fixture + 脚本都在 GitHub 公开,你可以自己跑。我们也欢迎竞品方提交 PR 补充他们的测试数据 — 真实数据没人喷,假数据藏不住。

每月 release 一份测试报告(PR diff 形式),让审计可读。

限制

  • 当前 fixture 偏向商务对话场景。文学翻译、诗歌、法律文本未覆盖。
  • 仅测试 Windows 平台。macOS / Linux 后续补。
  • 不测试硬件极差场景(旧 CPU / 无 GPU 时本地引擎速度会显著下降)。
  • 不测试网络极差场景(云引擎依赖网络)。

GitHub 仓库

  • 测试脚本与 fixture:github.com/crossmeet/benchmarks(占位 · 开仓中)
  • 每月发布的对比报告会以 markdown 形式归档在 reports/<YYYY-MM>.md,可订阅仓库。

如有指标建议、希望覆盖的语言对、或想贡献 fixture,请联系 research@crossmeet.com

立即开始

准备好让每段对话都像母语一样自然

无需信用卡 随时取消 本地优先
~100ms
端到端延迟
30+
支持语种
4
ASR 引擎
WIN 10/11
原生支持