使用指南

計費說明

概述

Vurbo.ai 採「點數制」計費:依實際使用的功能與時長扣點。點數可預先儲值,扣抵時依到期日先進先出(FIFO)。

  • 即時錄音/廣播:按分鐘計費(未滿一分鐘進位一分鐘),每分鐘費率=所啟用功能的點數加總。
  • 加值服務(摘要、重新翻譯):按文字量計費,依逐字稿字元數計算。
  • 廣播:除主講者端的內容處理費外,另依翻譯語言數與觀眾規模計「雲端翻譯」費。

即時錄音的扣點時機(廣播除外)

  • 每一分鐘開始時扣點:開始錄音時先扣第一分鐘,扣點完成後才會收到 session_started;之後每一分鐘開始時扣下一分鐘,結束錄音時不另外扣點
  • 可用點數不足一分鐘時,該分鐘不扣點:開始錄音時收到 auth_quota_exceeded;錄音中則在下一分鐘開始前結束,並收到 stt_quota_exceeded
  • 錄音中開關功能、增減聲道或翻譯語言,費率自下一分鐘起調整
  • 每個分鐘邊界後有 1 秒寬限:錄 60.5 秒計 1 分鐘、錄 61.5 秒計 2 分鐘
  • 暫停期間照常計費:暫停不會結束這場錄音;要停止計費,請結束錄音(stop)
  • 斷線等待續接的期間不計費:續接成功後恢復按分鐘計費
  • 音訊無法解碼的期間不計費:收到 audio_decode_failed 之後、音訊恢復辨識之前的分鐘不扣點(已經開始的那一分鐘照常計費),恢復後照常按分鐘計費;因此這場錄音的計費分鐘數可能少於錄音時長
  • 整場沒有收到可用音訊的錄音不計費:已扣的點數會自動退回
  • 長時間沒有語音會自動結束:連續一段時間(預設 15 分鐘)沒有偵測到語音,錄音會自動結束,避免忘記停止而持續計費;暫停中不計入。見 長時間沒有語音時自動結束

本頁費率以「點數」為單位;點數與台幣的兌換見下方「點數定價」。

除點數制外,另提供以合約授權固定功能組合的「吃到飽方案」,見下方 吃到飽方案。

點數定價

項目台幣(TWD)美元(USD)
1 點1.5≈ 0.047

美元金額以參考匯率 USD 1 ≈ TWD 32 換算(TWD 1.5 ÷ 32 ≈ USD 0.047),僅供參考;實際依扣款當下的即期匯率換算為準。

基礎用量(即時錄音,點/分鐘)

即時錄音每分鐘費率=下列已啟用功能的點數加總。「基礎語音辨識」為必計項,其餘依實際啟用疊加。

功能點/分鐘說明
基礎語音辨識1.0必計項
多語言辨識0.5雙語/多語來源辨識
說話者辨識0.5語者分離
整句翻譯0.2與即時翻譯擇一
即時翻譯0.5與整句翻譯擇一
翻譯第 2 種語言起(整句翻譯,每 +1)+0.2每多一種翻譯語言
翻譯第 2 種語言起(即時翻譯,每 +1)+0.4每多一種翻譯語言
語音合成(TTS)1.0即時語音回放
專業詞語庫免費術語庫/模糊詞校正/翻譯字典

專業詞語庫不另計費:術語庫、模糊詞校正、翻譯字典皆為免費功能,不影響每分鐘費率。

多語言辨識(來源語言)數量不另計費:同時指定多種轉錄語言(自動語言偵測)時,來源語言數量不影響費率。加乘只適用於「翻譯」輸出語言。

整句翻譯 vs 即時翻譯:兩者擇一計費(取費率較高者)。翻譯多種語言時,第 2 種語言起每多一種依上表加乘。

互譯模式

項目點/分鐘說明
即時互譯(conversation)1.5整合費率,已含語音辨識+翻譯
 + 語音合成(TTS)+1.0啟用語音回放時加計

互譯整合費率不含語音合成。啟用 TTS 時每分鐘為 1.5 + 1.0 = 2.5 點;未啟用則為 1.5 點。 錄音過程中可隨時開關語音合成,費率自下一分鐘起隨之調整。

多聲道語者分離(點/分鐘)

一場錄音接多支實體麥克風時,可啟用多聲道語者分離(recognition_mode: "multi_channel"):語者身分由聲道決定,可選每路各自辨識(per_channel)或各路輪流發言、共用一條辨識(shared)。多聲道屬「說話者辨識(語者分離)」的一種,適用於即時錄音;操作方式見 WebSocket API 參考。

每分鐘費率(N = 該分鐘採計的聲道路數,上限 8):

項目點/分鐘說明
基礎語音辨識1.0必計項(第 1 路已含在內)
說話者辨識0.5多聲道屬語者分離的一種,必計
多聲道路數加乘(N − 1) × 1.0第 2 路起,每路每分鐘 1.0 點(shared 模式 N 固定為 1,不加收)

即每分鐘 = 1.0 + 0.5 + (N − 1) × 1.0 點。

路數採計口徑

  • 每一分鐘開始時扣點,N 採當下開著的路數。
  • add_channel 於分鐘中途新增的聲道,自下一分鐘起納入採計;若在下一次扣點前就停用,或開始辨識後無法接收,下一次扣點會補計一次。同一分鐘內先後新增又停用多路時,依同時開著的最多路數補計。
  • remove_channel 停用一路後,下一分鐘起降價(當分鐘已在開始時扣點)。分鐘開始時已扣過點的聲道,停用後不會再計費。
  • 無法接收的聲道不採計:某一路的音訊在某一分鐘結算當下無法被接收(該路在該期間不會產生逐字稿),該分鐘不計入這一路;恢復後自下一分鐘起恢復採計。
  • 第一分鐘於錄音開始時結算,當下尚未收到任何音訊,因此依開通的路數計算。
  • 已開啟但未送出任何音訊的聲道照常採計——每一路即使無人說話,也建議持續傳送靜音音訊。

算例

  • 3 路:1.0 + 0.5 + (3 − 1) × 1.0 = 3.5 點/分鐘
  • 8 路、10 分鐘:1.0 + 0.5 + (8 − 1) × 1.0 = 8.5 點/分鐘;10 分鐘 = 85 點
  • shared 模式(各路輪流發言、共用一條辨識):不論開幾路,1.0 + 0.5 = 1.5 點/分鐘;add_channel/remove_channel 不影響費率

與其他計費軸的疊加

  • 翻譯(整句/即時翻譯,含翻譯語言加乘)、會議摘要、重新翻譯等其他計費項照常依各自費率表計費,與多聲道路數加乘互不影響、直接疊加。
  • 多聲道不支援語音合成(TTS)與廣播,無此兩項費用。

吃到飽方案的多聲道規則

  • 多聲道需方案包含此功能:方案未包含時,start 收到 plan_feature_not_allowed。
  • 方案可設定同時辨識路數上限:超過上限時,start/add_channel 當場收到 plan_feature_not_allowed(details.field 為 max_stt_streams),不會先放行再事後中斷。

音檔匯入(點/分鐘)

上傳音檔離線轉文字。批次處理採用較經濟的辨識服務,基礎費率低於即時錄音。

項目點/分鐘說明
匯入基礎語音辨識0.3批次處理專屬費率
匯入功能加乘依基礎用量表說話者辨識/整句翻譯(含翻譯語言加乘)依上表疊加

匯入的基礎語音辨識費率為 0.3 點/分鐘;其餘功能(說話者辨識、整句翻譯及其語言加乘)與即時錄音同表疊加。

加值服務(依文字量)

項目費率計費單位
會議摘要(首次生成)0.1 點每 1,000 轉錄字元
重新生成摘要(換模板)0.1 點每 1,000 轉錄字元
Ad-hoc 摘要(自帶內容,v1.9.1 新增)0.1 點每 1,000 內容字元
摘要翻譯(自帶內容,v1.17.0 新增)0.1 點每 200 內容字元
重新翻譯(全文)0.1 點每 200 字元
重新翻譯(單句)免費—

「字元」的定義:逐字稿的實際字元數(UTF-8 字元)。中文、日文、韓文每字算 1 字元;英文每個字母算 1 字元。

進位規則:不足一個計費單位仍以一個單位計,且每次至少收 0.1 點。 例:12,000 字元的摘要 = 1.2 點;12,050 字元 = 1.3 點。

摘要以「送入模型的逐字稿字元數」計費,不是產出的摘要長度。

單句重新翻譯不計費:僅「全文重新翻譯」按文字量計費。

可用點數不足時不產生摘要:即時錄音因可用點數不足而結束,或結束時可用點數不足以支付摘要費用時,不會產生摘要,並收到 summary_error(summary_insufficient_credit);逐字稿與錄音照常保存。

廣播計費

廣播計費分為兩條獨立計費線,每分鐘總費率=兩者相加:

  • 主講者端(內容處理):依上方「基礎用量」表計費(語音辨識、翻譯、語音合成、說話者辨識等),不受觀眾多寡影響。翻譯一律以即時翻譯計費,不受 start 的 realtime_translation 設定影響。
  • 雲端翻譯(內容派送):依翻譯語言數與最大觀眾人數兩項各自查表後相加。
  • 計費從開播那一刻起算:預備階段(standby)不計費;由預備階段轉為直播時,第一分鐘從開播起算。

廣播不另計「翻譯第 2 種語言起」加乘:廣播的多語言費用已完整包含在下方「翻譯語言數」項目中,主講者端不再重複計算語言加乘。

雲端翻譯費(點/分鐘)

每分鐘雲端翻譯費 = 翻譯語言數費率 + 最大觀眾人數費率。

依翻譯語言數

翻譯語言數點/分鐘
未啟用翻譯0
1 種2
2 種6
3–4 種14
5–8 種30
9–12 種62

依最大觀眾人數

最大觀眾人數點/分鐘
≤ 501
≤ 1003
≤ 5006
≤ 1,00012
≤ 2,00018
≤ 5,00038
≤ 10,00070
≤ 20,000137
≤ 30,000203

觀眾人數以廣播建立時設定的最大觀眾人數計(固定整場,非即時在線人數)。 帳號預設可設定的最大觀眾人數為 5,000 人;需要更高上限請洽業務開通。

計費範例

各範例的 TWD/USD 為參考換算(1 點 = TWD 1.5 ≈ USD 0.047),美元依當下即期匯率計算、僅供參考。 摘要費用依逐字稿字元數計算,各範例已標示假設的字元數。

範例 1 — 即時錄音(transcribe):純逐字稿、無翻譯,60 分鐘(逐字稿約 12,000 字元)

  • 錄音=基礎語音辨識 1.0 → 1.0 點/分;60 分鐘 = 60 點
  • 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
  • 合計 = 60 + 1.2 = 61.2 點(≈ TWD 91.8/USD 2.87)

範例 2 — 即時錄音(transcribe):整句翻譯 1 種語言,120 分鐘(逐字稿約 25,000 字元)

  • 錄音=基礎語音辨識 1.0 + 整句翻譯 0.2 → 1.2 點/分;120 分鐘 = 144 點
  • 會議摘要=25,000 ÷ 1,000 × 0.1 = 2.5 點
  • 合計 = 144 + 2.5 = 146.5 點(≈ TWD 219.8/USD 6.87)

範例 3 — 即時錄音(transcribe):整句翻譯 6 種語言,30 分鐘(逐字稿約 6,000 字元)

  • 錄音=基礎語音辨識 1.0 + 整句翻譯(0.2 + 第 2 種起 0.2×5 = 1.0)→ 2.2 點/分;30 分鐘 = 66 點
  • 會議摘要=6,000 ÷ 1,000 × 0.1 = 0.6 點
  • 合計 = 66 + 0.6 = 66.6 點(≈ TWD 99.9/USD 3.12)

範例 4 — 互譯(conversation):啟用語音合成,10 分鐘(逐字稿約 2,000 字元)

  • 互譯=整合費率 1.5 + 語音合成 1.0 → 2.5 點/分;10 分鐘 = 25 點
  • 會議摘要=2,000 ÷ 1,000 × 0.1 = 0.2 點
  • 合計 = 25 + 0.2 = 25.2 點(≈ TWD 37.8/USD 1.18)
  • 若未啟用語音合成:1.5 點/分 → 15 + 0.2 = 15.2 點

範例 5 — 音檔匯入(import):整句翻譯 1 種語言,30 分鐘(逐字稿約 6,000 字元)

  • 匯入=基礎語音辨識 0.3 + 整句翻譯 0.2 → 0.5 點/分;30 分鐘 = 15 點
  • 會議摘要=6,000 ÷ 1,000 × 0.1 = 0.6 點
  • 合計 = 15 + 0.6 = 15.6 點(≈ TWD 23.4/USD 0.73)

範例 6 — 廣播(broadcast):即時翻譯 3 種語言、最大 500 觀眾,180 分鐘(逐字稿約 38,000 字元)

  • 主講者端=語音辨識 1.0 + 即時翻譯 0.5 → 1.5 點/分(廣播不另計語言加乘)
  • 雲端翻譯=語言數 3 種(3–4 帶)14 + 觀眾 ≤ 500 級距 6 = 20 點/分
  • 每分鐘 = 1.5 + 20 = 21.5 點/分;180 分鐘 = 3,870 點
  • 會議摘要=38,000 ÷ 1,000 × 0.1 = 3.8 點
  • 合計 = 3,870 + 3.8 = 3,873.8 點(≈ TWD 5,810.7/USD 181.58)

範例 7 — 即時錄音(transcribe)+說話者辨識,60 分鐘(逐字稿約 12,000 字元)

  • 錄音=基礎語音辨識 1.0 + 說話者辨識 0.5 → 1.5 點/分;60 分鐘 = 90 點
  • 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
  • 合計 = 90 + 1.2 = 91.2 點(≈ TWD 136.8/USD 4.28)

範例 8 — 音檔匯入(import):純逐字稿、無翻譯,45 分鐘(逐字稿約 9,000 字元)

  • 匯入=基礎語音辨識 0.3 → 0.3 點/分;45 分鐘 = 13.5 點
  • 會議摘要=9,000 ÷ 1,000 × 0.1 = 0.9 點
  • 合計 = 13.5 + 0.9 = 14.4 點(≈ TWD 21.6/USD 0.68)

範例 9 — 廣播(broadcast):即時翻譯 5 種語言、最大 1,000 觀眾,60 分鐘(逐字稿約 12,000 字元)

  • 主講者端=語音辨識 1.0 + 即時翻譯 0.5 → 1.5 點/分(廣播不另計語言加乘)
  • 雲端翻譯=語言數 5 種(5–8 帶)30 + 觀眾 ≤ 1,000 級距 12 = 42 點/分
  • 每分鐘 = 1.5 + 42 = 43.5 點/分;60 分鐘 = 2,610 點
  • 會議摘要=12,000 ÷ 1,000 × 0.1 = 1.2 點
  • 合計 = 2,610 + 1.2 = 2,611.2 點(≈ TWD 3,916.8/USD 122.40)

範例 10 — 全文重新翻譯:60 分鐘錄音的逐字稿(約 12,000 字元)

  • 全文重新翻譯=12,000 ÷ 200 × 0.1 = 6 點
  • 合計 = 6 點(≈ TWD 9/USD 0.28)
  • 若僅重新翻譯個別句子:免費

吃到飽方案

除點數制外,另提供「吃到飽方案」(v1.9.0):以合約授權固定的功能組合與使用上限,期間內使用方案內功能不逐分鐘扣點。方案的功能組合與各項上限由後台依合約自訂;可隨時透過 GET /api/v1/me/plan 查詢目前方案的內容、用量與限制何時恢復。

方案規則

  • 方案綁定在單一 API Key 上:一份授權對應一把 API Key。同一帳號底下的其他 API Key 不受影響,仍依點數制計費;要讓多把 API Key 都吃到飽,需要各自綁一份授權。
  • 方案不含的功能直接拒絕:呼叫方案未包含的功能會收到 plan_feature_not_allowed(REST 為 HTTP 403;WebSocket 為錯誤訊息),不會回落為點數扣抵。詳見 錯誤碼參考 – 方案限制錯誤。
  • 廣播一律不含在吃到飽方案內:廣播照點數計費(見上方「廣播計費」)。
  • 基本功能(所有方案必含):基礎語音轉錄、專業詞語庫、摘要、全文重翻。

方案可設定的上限

上限說明
同時識別語言數超過方案上限時 start 被拒(too_many_languages,details.max 為方案上限)
單次錄音上限單場錄音的長度上限
使用時數門檻達門檻後定期中斷當場錄音(daily_limit_disconnect),可立即開始新的錄音;達每日硬上限則收到 daily_limit_reached(REST 事前閘為 plan_daily_limit_reached,HTTP 402),依方案規則重置(每日上限隔日重置)後恢復
併發錄音上限同一把 API Key 同時進行的錄音數;達上限時回 concurrency_limit_reached。名額在伺服端送出 task_complete 時釋放,收到後即可開始下一場
多聲道路數上限多聲道語者分離的同時辨識路數上限;超過時 start/add_channel 當場被拒(plan_feature_not_allowed,details.field 為 max_stt_streams)

判斷時機:即時錄音的單次錄音上限、使用時數門檻與每日硬上限,都在每一分鐘開始前判斷;達到時下一分鐘不會開始,也不計入用量。同一把 API Key 同時進行多場錄音時,達到定期中斷的門檻後,每一場都會在各自的下一分鐘開始前中斷。

在同一條連線上重新開始:錄音被中斷後可以立即送出 start,但要等上一場處理完成(收到 status: "ended")後才會收到 session_started,視摘要長度可能需要數秒到數十秒。


版本:V1.24.1 最後更新:2026-10-07

Copyright © 2026