众所周知,随着以ChatGPT为主的AI大模型的带动下,越来越多的企业机构开始研究AI大模型,但限于地址及语言,AI大模型研发成本可能不一样,下面我们来看看,哪些语言的AI大模型最贵,哪个最便宜!
最近牛津大学一项研究显示:由于OpenAI等服务所采用的的服务器成本衡量和计费方式,导致英语输入和输出费用比其他语言便宜的多,而且其中简体中文的费用大概是由于的两倍,西班牙语是英语的1.5倍,最贵的是缅甸的掸语,是英语的15倍。
举个例子,让一个LLM处理一句缅甸语句子需要198个词元(tokens),而同样的句子用英语写只需要17个词元。词元代表了通过API(如OpenAI的ChatGPT或Anthropic的Claude2)访问LLM所需的计算力成本,这意味着缅甸语句子使用这种服务的成本比英语句子高出11倍。
词元化模型(即人工智能公司将用户输入转换为计算成本的方式)意味着,除了英语之外的其他语言使用和训练模型要贵得多。这是因为像中文这样的语言有着不同、更复杂的结构(无论是从语法还是字符数量上),导致它们需要更高的词元化率。例如,根据 OpenAI 的 GPT3 分词器 ,“你的爱意(your affection)”的词元,在英语中只需要两个词元,但在简体中文中需要八个词元。尽管简体中文文本只有 4 个字符(你的爱意),而英文有 14 个字符。