研究人员发现，谷歌Gemini表现不如GPT-3.5 Turbo

SEO教程

正在检查是否收录...

在近期的一项研究中，来自卡内基梅隆大学和BerriAI的研究团队对Google Gemini Pro进行了深入的评估，并发现其在多项任务中表现不如OpenAI的GPT-3.5Turbo。这一发现无疑是对Google在生成式人工智能领域与OpenAI竞争的雄心的一次沉重打击。

Gemini Pro 与 GPT-3.5Turbo 对比

Gemini Pro是Google公司最新推出的大型语言模型（LLM），其在演示视频中展示了其强大的功能。然而，研究团队发现Gemini Pro在多数任务上的表现不如OpenAI的老款GPT-3.5Turbo。这一结论令Google研究人员感到挫败，尤其是考虑到他们在Gemini的开发上投入了大量时间和精力。

尽管Gemini Pro的表现不佳，Google仍然保持乐观态度，表示他们即将推出更强大的版本Gemini Ultra，预计将于2024年初问世。据Google的内部研究称，Gemini Ultra在性能上超过了GPT-4。然而，这一消息并未能完全抚平研究结果给公司带来的打击。

研究方法与测试结果

研究团队在LiteLLM平台上测试了四个不同的LLM:Google Gemini Pro、OpenAI GPT-3.5Turbo、GPT-4Turbo和法国初创公司Mistral最新推出的Mixtral8x7B。测试内容涵盖了STEM、人文和社会科学领域的57个多项选择问题，以及一些与通用推理、数学和编程相关的任务。

研究结果显示，在多项选择问题的测试中，Gemini Pro的准确性低于GPT-3.5Turbo和GPT-4Turbo。Gemini Pro在人类性、形式逻辑、初等数学和专业医学等领域的表现较差，其中一部分原因是Gemini在某些问题上拒绝回答，声称由于安全和内容限制无法遵循。然而，在安全和高中微观经济学等领域，Gemini Pro的表现略优于GPT-3.5Turbo，但进步有限。

Gemini在语言翻译领域表现出色，优于GPT-3.5Turbo和GPT-4Turbo。然而，研究指出，Gemini Pro在某些语言对中阻止回应的情况下表现不佳，这暗示了一种过于激进的内容审查/安全系统。

对Google AI雄心和用户的影响

研究结果明显对Google在生成式人工智能领域与OpenAI竞争的雄心构成了打击。由于更强大的Gemini Ultra模型要到明年初才会发布，这可能意味着Google在AI性能上将至少在未来一段时间内落后于竞争对手。尽管如此，研究也显示，Mistral公司的Mixtral8x7B模型在大多数方面的表现也不如GPT-3.5Turbo，为Google在AI领域带来一丝希望。

尽管Gemini在某些方面表现出色，但研究结果让人难以忽视OpenAI目前在消费者和企业面向的生成式人工智能领域的领先地位。随着Gemini Ultra的推出，Google可能会迎头赶上，但目前GPT-4仍然是首选，至少直到Gemini Ultra在新的一年发布。

geminigptgooglegpt-3.5gpt-3openaigpt-4人工智能llm生成式人工智能生成式2024urlopenai gpt-3stem初创公司研究人员准确性语言模型竞争对手语言翻译大型语言模型演示视频