#!/usr/bin/env python3 """ 变异体统计 —— **口径的唯一权威**(此前数字只活在信里,换过 40/48/58/41 四种说法)。 为什么需要它:同一个变异体可能出现在多个 `jobs*.json` 里、挂着不同的 `test` 键 (跨批重锚留下的),于是"按判据文件分组求和"会把它算多次 —— 而"job 集合是什么" 以前没有定义,谁算都能得一个数。 口径(写死在这里,别在信里另说一套): · 不同变异体 = 按 (file, pat, repl) 三元组去重(`retired: true` 的条目不计); · 跑起来 = 该三元组的锚点在该文件里**恰好命中 1 次**(与 mut.py 同一条件); · 跳过 = 锚点命中 ≠ 1; · on_new_criteria = 该变异体的**每一个** test 键都指向本次新增的两个判据文件 (口径 A:回答"新判据抓住了多少",不因交叉归类虚高); · 另报口径 B(任一 test 键挂新增文件)作参考 —— 它**只增不减**,别拿来报数。 用法:python3 client/electron/test/mutants/summary.py """ import glob import json import os import re import subprocess import sys from collections import defaultdict HERE = os.path.dirname(os.path.abspath(__file__)) JOBS_DIR = os.path.join(HERE, 'jobs') # mutants/ → test/ → electron/ → client/ → 仓库根 REPO = os.path.abspath(os.path.join(HERE, '..', '..', '..', '..')) # test 键 → 判据文件:**唯一来源**是同目录的 test-keys.json(与 mut.py 共用一份) _KEYS = json.load(open(os.path.join(HERE, 'test-keys.json'), encoding='utf-8')) TESTFILE = {k: v for k, v in _KEYS.items() if k != '_'} NEW_CRITERIA = { 'test/harmony-admin.test.mjs', 'test/harmony-imageprep.test.mjs', } def main(): entries = [] for f in sorted(glob.glob(os.path.join(JOBS_DIR, 'jobs*.json'))): for j in json.load(open(f, encoding='utf-8')): j['_from'] = os.path.basename(f) entries.append(j) active = [e for e in entries if not e.get('retired')] retired = len(entries) - len(active) def anchor_hits(e): path = e['file'] if os.path.isabs(e['file']) else os.path.join(REPO, e['file']) try: src = open(path, encoding='utf-8').read() except OSError: return -1 return len(list(re.finditer(e['pat'], src))) by = defaultdict(list) for e in active: by[(e['file'], e['pat'], e['repl'])].append(e) ran = skipped = only_new = any_new = 0 skipped_detail = [] for key, group in by.items(): h = anchor_hits(group[0]) if h != 1: skipped += 1 skipped_detail.append((key, group, h)) continue ran += 1 files = {TESTFILE.get(e['test'], e['test']) for e in group} if files <= NEW_CRITERIA: only_new += 1 if files & NEW_CRITERIA: any_new += 1 # 基线自证:变异跑完必须**逐字节还原**。这一条以前只在信里说("sha256sum -c 7/7 OK")—— # 与"数字只在信里"同一个毛病。挪进 RESULT 行:万一某次变异把文件写坏了, # 套件这一行会直接显形,而不是等下一个人去信里找。 baseline_ok = None bl = os.path.join(HERE, 'baseline.sha') if os.path.exists(bl): try: r = subprocess.run(['sha256sum', '-c', bl], cwd=REPO, capture_output=True, text=True, timeout=60) # 底本里允许 `#` 注释(记"为什么重算基线"用)—— 计数与校验都要跳过它们, # 否则注释会被当成"一项没还原"(我第一次加注释就踩了这个) total = sum(1 for ln in open(bl, encoding='utf-8') if ln.strip() and not ln.lstrip().startswith('#')) ok = sum(1 for ln in (r.stdout or '').splitlines() if ln.endswith(': OK')) baseline_ok = (ok == total, ok, total) except Exception: baseline_ok = (False, -1, -1) bl_note = '' if baseline_ok is None: bl_note = ' baseline=(没有 baseline.sha)' else: good, ok, total = baseline_ok bl_note = f' baseline={ok}/{total}' + ('✓' if good else '✗**有文件没还原**') print(f'RESULT mutants={len(by)} ran={ran} skipped={skipped} ' f'on_new_criteria={only_new}' f'(口径A=只挂新判据 {only_new} / 口径B=任一挂新判据 {any_new} / ' f'原始条目 {len(entries)},其中 retired {retired})' + bl_note) if skipped_detail: print('跳过(锚点命中≠1 ⇒ 跑不起来):') for key, group, h in skipped_detail: srcs = ', '.join(sorted({e['_from'] for e in group})) print(f' hits={h} {key[0]} 「{group[0].get("why", "")}」 ({len(group)} 条条目:{srcs})') print(' ⚠️ hits=0 通常是**过期条目**(锚点是旧写法)—— 请标 retired 或删除,') print(' 否则它会把 skipped 一直抬高(方向与"让欠账显形"相反)。') return 0 if __name__ == '__main__': sys.exit(main())