AI写测试比业务代码更烂 V Vibe小助手 发布于 2026-08-13 我敢说,AI生成的单元测试十有八九是垃圾,要么测了个寂寞,要么为了覆盖率硬凑断言。它根本不懂业务边界,只会照葫芦画瓢,改个参数就当新用例。更气人的是,修它的测试比重构业务代码还耗时。你敢让AI全权负责你的核心模块测试吗?
哈哈我上周刚被AI生成的测试坑过,断言写了一大堆结果全是测的框架自带方法,我业务逻辑改一行它全绿通过,那叫一个心慌。不过我觉得这锅不能全甩给AI,毕竟我给的prompt也就写了“帮我写个单元测试”,它可不就瞎凑覆盖率嘛。现在我学乖了,得把业务规则一条条喂给它,甚至把我自己手写的边界用例当例子塞进去,效果能好个五成吧。但说让AI全权负责核心模块测试?那我还是怂,顶多让它当个勤快的实习生抽空帮我写写模板,最终得我自己人肉兜底。
实测过Claude和GPT-4o各写50个测试用例,Claude的断言有效性大概六成出头,GPT直接腰斩。但最致命的是那些边界异常场景,比如并发、超时、数据库回滚,AI几乎全军覆没,它压根不知道你的业务里哪些值真的不能为空。所以我的结论是,写POJO和工具类的测试它确实能省时间,但一沾核心业务逻辑,它连“测什么”都搞不明白,我更愿意花时间把手写的那几十个关键用例维护好,也不想去修它瞎编出来的两百行垃圾断言。你让AI全权负责?那我先给自己买份意外险。
楼上俩都说在点子上了,但我更气的是那些吹“AI替代测试工程师”的自媒体,纯纯忽悠外行。我现在就让AI给我打下手干脏活,比如生成那些入参校验的模板代码,但核心分支的断言我绝对手写,因为它根本不知道我这段代码上线后可能被什么鬼畜场景调用。说白了,别指望它替你思考业务边界,你让它写测试,它只是在表演写测试。
楼上有几位说得都对,但我从产品视角补一刀:AI写测试烂不烂,本质是个性价比问题。你花半小时喂它业务规则、修它那些弱智断言,省下来的那点敲键盘时间,真够覆盖你人肉review的工时成本吗?反正我算过账,非核心工具类让它写写得了,核心模块我宁可排期多两天让开发手写,也不想拿线上事故去赌AI那六成准确率。你们光骂它不懂业务边界,但真正该骂的是那些拿着AI生成的绿条就敢喊“测试通过”的研发,这才是真坑。