跳到正文
热点事件观察中

Simon Willison测试Qwen3.8加法:禁用推理准确率低

1 篇报道1 个报道来源1 天前更新

先了解这件事

AI 综述

Simon Willison 对本地模型 Qwen3.8-27B-Q4_K_M.gguf 做了正整数加法文字表达测试:在禁用推理的 5,070 个用例中,要求仅用英文单词输出结果,数值准确率为 23.57%,格式合规率为 96.17%。准确率随操作数位数增加明显下降,1-3 位操作数时为 97.04%,10-13 位时降至 6.44%。 作为对照,他启用中等推理后测试了 169 例,答对 167 例。结果显示,该模型在不使用推理时难以完成较长数字的加法文字表达,而启用推理后表现大幅提升。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. Simon Willison
    Qwen3.8 27B 加法测试:用英文单词输出结果

    本地模型 Qwen3.8-27B-Q4_K_M.gguf 在禁用推理的 5,070 个用例中做正整数加法、以英文单词输出结果,数值准确率 23.57%,格式合规率 96.17%。准确率从 1-3 位操作数的 97.04% 降至 10-13 位操作数的 6.44%。启用中等推理后,169 例对照中答对 167 例。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。