脚本式与自发式语音、双人对话、方言录制。受管的说话人招募,配合严格技术规格——采样率、声道配置、录制环境、说话人画像——每批次验证。
7 个语对已在生产交付,另有 7 个可启动——语音 AI 当下的前沿,也是大多数供应商难以规模化获取自然母语语码转换的地方。
生产级规模的多语言转录与验证 QA,按批次周转、按客户准则执行——原始音频到可用训练数据之间的质量关口。
由母语评测员进行充分性、流畅度、排序和 LQA——对模型输出的人类判断,跨语言、成规模地一致执行。
批次导入、音频-参考对齐检查、范围确认——不匹配在开工前就退回。
固定语言团队在受管平台上领任务——语境逐批累积,而非每次归零。
按准则作业、per-file 工时记录,产能可预测、问题文件早暴露。
对照书面变体指南做二次复审,指南在每轮修正后更新。
一键导出,附工时报告和修正闭环追踪——同一问题不再复发。
语音 AI 至今仍在语码转换语音上失灵——众包平台也无法稳定获取,因为天然会语码转换的人,没法靠筛选"母语"这一项找出来。传为以管理型母语者团队运作:7 个语码转换语对已在生产交付,另有 7 个可启动,每一位贡献者都有书面同意与来源记录。
粤语–英语(香港)· 普通话–英语(中国大陆)· 台湾华语–英语 · 日语–英语 · 韩语–英语 · 他加禄语–英语(Taglish)· 土耳其语–英语
印地语–英语(Hinglish)· 马来语–英语 · 泰米尔语–英语 · 印尼语–英语 · 泰语–英语 · 越南语–英语 · 海湾阿拉伯语–英语
有单一责任主体的受管生产——不是匿名众包。经筛选的贡献者、严格的规格合规、按批次的质量确认。
香港粤语、台湾国语、简体普通话及地区变体——外加韩语、日语、菲律宾语、土耳其语等,且在增加。通用供应商当作边缘情况的变体,正是我们的核心。
固定语言团队提供稳定内核、语境逐批累积;万人级译员网络在每周量峰时吸收波动,无需每次重新 onboarding。自助平台自动完成派发、交付与 QA 追踪。
每位贡献者书面知情同意、每批次来源可追溯——数据来源与授权可审计,而非开放网络抓取。
通过 ISO 17100 与 ISO 18587 认证,结构化审校内建于交付,而不是出了问题才补。
我们作为分包生产伙伴,支持领先的 AI 平台供应商和更大的数据公司——公司对公司的合作模式,而非众包市场。
为某全球性 AI 项目,在三周内把粤英语码转换录制项目从试点扩展到数百个脚本——批次通过、质量确认。
运行一条覆盖数十种语言变体的滚动式多语言转录验证产线,每周向某领先 AI 平台供应商的数据供应链交付批次。
客户项目均保密。以上描述的是工作的形态——受管生产、严格规格、按批次确认质量——而非相关方。
AI监管正在把数据文档化变成采购要求。在欧盟AI法案的透明度义务下,AI系统的提供方越来越需要证明训练数据的来源与授权。我们的生产从设计上就是"溯源优先"——每位贡献者的书面同意与来源记录、批次级台账、可审计的交付元数据——让你今天采购的数据,不会成为明天的合规问题。
传为按客户规格交付亚洲语言语音与语码转换数据集:16–48 kHz 采样,WAV/FLAC 格式,单声道或分离双声道,覆盖照读、半照读到自然对话语域;说话人构成按性别、年龄段与地区口音配比。每个批次附带批次级技术 QA、可直接入库的元数据,以及书面的说话人同意与来源记录,可支撑 AI 监管的文档化要求。
16–48 kHz WAV/FLAC · 单声道或分离双声道 · 照读/半照读/自然对话 · 按规格配比安静与嘈杂环境。
母语者按性别与年龄段配比 · 地区发音受控 · 语码转换组合含粤英、普英。
批次级技术 QA · 说话人 ID、批次 ID、环境与声道标签 · 可加转录验证作为第二层。
亚洲语言及其地区变体——香港粤语、台湾国语、简体普通话及其他中文变体——同时覆盖韩语、日语、菲律宾语、土耳其语等不断增加的语种。也处理粤英、普英等语码转换。
每位贡献者在书面知情同意下参与,来源按贡献者和批次追溯。作为通过 ISO 17100 与 ISO 18587 认证、采用受管生产的公司,数据来源、授权与处理均可审计,而非开放众包匿名获取。
能。语音采集遵循严格规格——采样率、声道配置、录制环境、说话人画像、脚本设计——每批次交付前验证。转录与评测按客户准则执行,以生产级规模做 QA。
可以——我们以公司对公司的方式,为领先的 AI 平台供应商和更大的数据公司提供受管产能,交付通用供应商难以获取的亚洲语言和语码转换音频。
我们做的是有单一责任方的受管生产,而不是匿名众包——经筛选的母语者、严格的规格合规、书面知情同意与来源追溯、按批次的质量确认。这在语码转换和低资源亚洲语言变体这类最难的场景里尤其关键。
每个批次都走入库对齐检查。不匹配(文件被重新剪辑、脚本被上游修改)在开工前就退回给你,而不是在花了工时对着错误文本"验证"之后才发现。
语音和验证工作通常按工时计费、per-file 记录,你能清楚看到时间花在哪;采集类按交付单元报价。固定团队提供稳定内核,更大的译员网络吸收每周量峰,无需每次重新 onboarding。
是。每位贡献者均签署书面同意;每次交付保留来源与批次记录;元数据可审计。我们不提供法律意见,但生产流程从设计上支持 AI 提供方履行透明度与溯源文档义务。
归委托客户所有,按项目约定的授权结构执行。说话人知情同意以书面收集,覆盖商业化 AI 训练用途;除非另有约定,我们不保留复用权。权利文档——同意范围、许可用途、来源记录——随每次交付一并提供。
音频为约定采样率的 WAV/FLAC,保留声道分离;转写与标注为 JSON、TSV 或客户自定义格式;逐条元数据含说话人 ID、人口属性分组、环境与声道标签,外加批次级 QA 结果。按你的管线节奏以安全传输分批交付。
只有你委托我们生产的数据才是训练数据——你自己的材料不会。为参考、规格说明或评测目的提供给我们的客户内容,均受标准保密条款约束;如流程中涉及任何 AI 工具,只经由已开启零数据留存(ZDR)与模型训练退出(opt-out)的企业级 API 层处理,我们绝不把客户材料放进免费或消费级 AI 工具。我们交付的数据集授权给委托方,并随附同意范围与来源记录。
对敏感或受监管的工作,我们可以走全程无 AI 参与的纯人工工作流。应要求,我们也可在 NDA 下披露所使用的具体引擎,并签署你方的数据处理协议(DPA)。
能——这是我们的核心线之一。语码转换语音无法靠"按母语筛选贡献者"的众包方式获取,因为天然会语码转换的人根本不是这样找出来的;它需要管理型母语者团队,并就场景与语域做过简报。目前已有 7 个语对在生产交付:粤语–英语、普通话–英语、台湾华语–英语、日语–英语、韩语–英语、他加禄语–英语、土耳其语–英语;另有 7 个可启动:印地语–英语、马来语–英语、泰米尔语–英语、印尼语–英语、泰语–英语、越南语–英语、海湾阿拉伯语–英语。
照读、自然口语、双人对话三种形态均可,每位贡献者都有书面同意与来源记录。可以先做一个免费试做批次,让你在正式合作前就按自己的规格检验切换点处理和转写规范。
把它当数据问题,而不是供应商设置项。通用语音识别恰好在语言切换点上崩——嵌入的产品名、数字、借词——因为它是用单语语料训练的,模型没见过的分布,没有哪个配置开关能补上。可行的路径是:用你们自己通话场景的真实语码转换音频做基准测试,按切换点计分而不是整句平均词错率;然后用按你的场景和语域、由天然双语者录制的训练数据去适配模型。
这种按规格录制的生产正是我们做的:预约热线、客服通话、对话形态,按你的领域词表做简报,覆盖上面列出的语码转换语对。
三个测试,全都不需要点名品牌。第一,用你目标语区的真实语码转换音频做基准——不是供应商的演示集——并按语言切换点计分,而不是整句平均。第二,看命名实体和借词能不能活下来:嵌在另一种语言里的产品名,恰恰是一通电话商业价值最集中的地方,也是模型最容易把它"纠正"成噪音的地方。第三,问系统能用什么数据做适配——如果一家供应商无法用自然语码转换音频微调,它现在的准确率就是它的天花板。
无论最后选哪个引擎,真正拉开差距的是背后的评测集和适配数据。用天然双语者按规格把这两样建出来,就是我们供应的部分。