02 第 2 章 · 智 人工智能

跳过输入法? Skipping the IME?

和 AI 智能体说话,能不能跳过输入法、直接敲拼音?48 次真实调用给出的答案是:日常指令可以;可一遇同音词,意思就塌了——只要把关键词留成汉字,意思便回来了。这是第一篇 AI 论文,入选爱丁堡 UKAIRS 2026。

图 2 — 无声调的拼音是一场游走,随时可能被错误的词吸收。

图 2 shi shi:一串按键,六个词 诚实标签: 实测
  1. 跳过
  2. 挑过
  3. 调过
  4. 条过不成词

跳过输入法

已录用海报

Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents

Xiaoxiao Zhouyi · Yanzhen Li

合作
Yanzhen Li
赛道
Emerging Research(新兴研究) · 海报
会议
英国 AI 研究研讨会(UKAIRS)2026,爱丁堡 · 2026 年 11 月 24–25 日
海报
#181 · 午餐与海报第 3 场 · 2026 年 11 月 25 日 · 13:15–14:15
录用
2026 年 8 月 11 日

图 2.1 shi shi 实测

  1. 01打字,不经过输入法
  2. 02智能体听见的
  3. 03混合提示
  4. 04得分

01 / 04 · 打字,不经过输入法

你只打出了读音。

7 次击键,不选字,不标调。很快——也有一点失真。

02 / 04 · 智能体听见的

智能体听见的,是 6 个词。

声调本可以区分它们。去掉声调,「事实」「实施」「实时」等词坍缩成同一个字符串。

03 / 04 · 混合提示

关键的那个词,留在汉字里。

句子骨架用拼音,关键术语用汉字。歧义消失,速度还在。

04 / 04 · 得分

三分之一,或者全对。

同音字压力测试——Codex(n = 15)与 Claude Code 复核(n = 9):纯拼音平均 0.333;汉字与混合提示均为 1.00。

纯拼音
0.333
汉字锚定
1.00
  1. 事实 shìshí 真实情况
  2. 实施 shíshī 付诸执行
  3. 实时 shíshí 即时
  4. 时事 shíshì 新闻时事
  5. 史诗 shǐshī 长篇叙事
  6. 失事 shīshì 事故

无调拼音到达智能体时只是一个字符串。每个候选词按首达渗流着墨:墨从落笔处进入,每个像素在它的首达时刻变黑(到达场在构建时烘焙)。

图 2.2 同音字星图 示意

输入或选择键码

  1. shi shi
  2. shu
  3. mai

0.13P(想说「事实」) · 在同音词之间均匀猜测(无语境)。

同音字星图 · shi shi事实shìshí真实情况 13%你想说的实施shíshī执行 13%实时shíshí即时 13%时事shíshì新闻 13%史诗shǐshī长篇叙事 13%逝世shìshì去世 13%失事shīshì事故 13%誓师shìshī动员 13%shi shi
  • 事实 shìshí 真实情况
  • 实施 shíshī 执行
  • 实时 shíshí 即时
  • 时事 shíshì 新闻
  • 史诗 shǐshī 长篇叙事
  • 逝世 shìshì 去世
  • 失事 shīshì 事故
  • 誓师 shìshī 动员
图 2.2 把无调拼音看成星形图上的随机游走:每个同音词都是吸收靶,每个靶下方带声调的拼写,正是键码删掉的信息。示意模型(均匀先验加语境漂移),不是实测的模型概率。关键词直接用汉字写,就是一条直达正确靶的捷径。

表 2.1 智能体实际的表现 实测

探针对比质量n
算术客观题Codex全部六种输入条件全部 1.006
骑车好处 JSONCodex非首字母写法 vs 首字母简拼0.3331.006
简拼稳定性Codex原文 vs 首字母简拼(两种模式)0.333 / 0.4441.0012
同音字压力题Codex原文 / 混合 vs 纯拼音写法0.3331.0015
同音字复核Claude Code原文 / 混合 vs 完整拼音0.3331.009
48 次有效调用 · 简体中文 · 纯文本 · 确定性评分48

模型交回了什么

  1. shi shi jian yan 应为: 事实检验 · 实施检验 事实检验 · 实施检验

    • Codex · 原文写法事实检验 · 实施检验✓
    • Codex · 完整拼音shi shi jian yan · shi shi jian yan✗
    • Codex · 去空格事实检验 · 事实检验✗
    • Codex · 混合写法事实检验 · 实施检验✓
    • Claude Code · 完整拼音实时检验 · 实时检验✗
  2. shu 应为: 书 · 树 · 输 · 熟 书 · 树 · 输 · 熟

    • Codex · 原文写法书 · 树 · 输 · 熟✓
    • Codex · 完整拼音书 · 树 · 数 · 输✗
    • Codex · 去空格shu · shu · shu · shu✗
    • Codex · 混合写法书 · 树 · 输 · 熟✓

日常的指令骨架不妨跳过输入法;但确切的人名、领域术语与同音词,必须用原文字锚定。

初步的设计规则 · Emerging Research(新兴研究) · 海报

评测框架已定义的输入方式

  1. 中文拼音丢失 声调与最终的选字
  2. 日语罗马字丢失 汉字的选择
  3. 越南语键盘输入丢失 变音符号
  4. Hinglish(拉丁字母印地语)丢失 原文字的拼写
  5. Arabizi(拉丁化阿拉伯语)丢失 特定文字的拼写
  6. 俄语转写丢失 原文字的专名
  7. Greeklish(拉丁化希腊语)丢失 原文字的专名
  8. 韩语键盘友好输入丢失 原文字的专名

轮到你 · 坍缩

打一串不带调的拼音

一本小词典,告诉你有多少个词共用这几下击键。读原始拼音的智能体,只能在它们之间猜。

试试

  1. shi shi
  2. shou da
  3. zhou yi xiao xiao

shou da

  1. 首达
  2. 手打

2 个词共用这几下击键。

去掉声调,我的两条研究线是同一个词:首达(shǒudá),与手打(shǒudǎ)。

图 2 无声调拼音自动敲出;候选词逐个洇开;校对记号留下「事实」、划掉其余;关键词留作汉字,分数就从 0.333 回到 1.00。

展品:论文

Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents

跳过输入法?面向 LLM 智能体的键盘友好多语言提示

Xiaoxiao Zhouyi, Yanzhen Li

UKAIRS 2026 · Emerging Research (poster), Edinburgh ·

已录用 · 181 号海报,2026 年 11 月 25 日,爱丁堡

记录

说中文的人打字,先敲拼音,再让输入法挑字。如果跳过最后这一步,直接把拼音发给 AI 智能体呢?更快——可「事实」和「实施」都是 shi shi。这一章,是一项测量「意思在哪里塌掉」的研究,以及它最后得出的那条规则。

ime-eval 用成对的提示驱动真实的编程智能体——原文写法对照键盘友好写法——规矩很严:默认空跑,每一次真实调用都要授权,结果只写一次。研究分阶段推进,每一阶段花钱之前都由一个独立的智能体审计;负结果也原样保留:让模型先把中文还原出来,反而更糟。

结论小而锋利:日常指令经得起拼音,同音词却经不起——除非把关键词留成汉字,那样就能完全恢复正确。论文入选爱丁堡 UKAIRS 2026。围绕它的,是一种工作方式:模型提出,其他智能体攻击,由计算来裁决。

一种 AI 原生的做数学方式

在首达研究线里,逐渐形成了一个可复用的回路:AI 模型提出推导与代码,另一组智能体专门攻击这些论断,数值计算充当裁判,精确代数交给 Lean 4 机器核验。有据可查的例子包括:提出的公式没通过数值核对,被弃用;基于仓库的审计,抓到了外部模型看不见的错误;每次投稿前的多轮评审——单次审计最多动用约六十个智能体。原则浓缩成一句话:AI 能生成更多科学上的可能,研究者的本事,是判断哪些值得相信。

进行中

单次审计智能体数
≈ 60
Lean 核验定理(折叠论文)
46

一条弯向 AI 的研究线

在随机游走的首达研究之外,2026 年的博士工作逐渐延伸到 AI:评测 LLM 智能体,研究人机交互与多语言输入,并把多模型 AI 工作流当作科研仪器——让对抗式审计的分歧由计算来裁决。习惯是一脉相承的:先把隐藏的路径测出来,在有独立证据之前,不轻信任何一个数字。UKAIRS 2026 的录用,是这条线上第一项经同行评审的 AI 成果。

进行中

GOSIM 巴黎 2026

5 月 5–6 日,参加在巴黎 Station F 举办的 GOSIM Paris 2026,主题是「The Agentic AI Convergence」。会后写下的体会是:开源智能体生态正在离开模型展示,转向工具互通、模型服务、边缘部署、生产系统与可信工作流——与评测研究正在走的方向不谋而合。

已参会

ime-eval:键盘友好提示的评测框架

问题起于自己:跟智能体说话,能不能直接打拼音?ime-eval 把它变成了一件仪器。它直接驱动真实的命令行编程智能体,而不是裸调 API;每条原文提示都配上一组键盘友好的写法——完整拼音、去空格、轻微错字、首字母简拼,以及只把关键词留作原文字的混合写法;并为八种输入习惯建立配置:日语罗马字、越南语键盘输入、Hinglish、Arabizi、俄语转写、Greeklish、韩语等。从第一天起就立下铁律:配置一律自动生成,默认只做空跑,结果只写一次,用沙箱防止答案泄漏给智能体。框架在此署名,暂未公开。

已完成

输入写法
8
试点提示变体
144

三个模型接力,一个人当裁判

整项研究以多个 AI 系统接力的方式推进:一个编排模型写每一阶段的任务书;一个编程智能体负责实现和执行;第三个独立的智能体在花掉任何真实调用之前做就绪审计——同音字阶段它给出的结论是「可以开跑」。每个阶段结束,都打包一份状态与决策交回编排者,每一步都提交进 git。人的角色是总设计师:定阶段,批预算,递接力棒。

已完成

独立就绪审计
4

四次调用,四个 bug,然后干净的 1.0

在花掉任何一次模型调用之前,先把框架加固:工作目录去泄漏;真实运行由环境变量开闸,并设硬性调用上限;preflight 检查与确定性评分到位;每一步都经独立审计复核。第一次真实冒烟只用了四次授权调用,就揪出四个调用层的 bug——schema 相对路径、输入流阻塞,以及结构化输出的严格规则。修好之后,链路给出正确答案,得分 1.0。测试用例也在这一路上从 47 个增加到 87 个。

已完成

首次成功前的调用
4
发现的 bug
4

抓住一个隐形的重复

对全部 24 道试点题做了一次零成本审计,发现「简拼」条件在三道题上(一道中文、两道越南语)与完整罗马化写法逐字节相同——若不察觉,真实调用会被悄悄浪费。现在改用按文字类型区分的确定性转换:中、日、韩的罗马化按音节取首字母(shang dian li 变成 sdl);变体锁文件还记下每条渲染结果的摘要,哪怕只改了代码,也会被漂移检测抓出来。

已完成

六种写法:先撞天花板,再遇悬崖

算术题在六种输入写法下全部答对——证明管道没问题,但题目本身已经饱和。约束类任务开始拉开差距:完整拼音、去空格拼音、带错字的拼音,以及夹英文术语的混合写法,都交出了要求的「三个元素的 JSON 数组」;只有拼音首字母简拼保住了主题、丢掉了结构,得分 0.333。按占位的击键模型估算,首字母简拼只需原生写法约 0.39 的击键——省下的力气是真的,丢掉的质量也是真的。

已完成

格式题上的首字母简拼
0.333 (native 1.00)

反直觉:先还原成中文,反而更糟

12 次调用的重复实验证实,简拼带来的质量下跌是稳定的:直接回答拼音首字母提示,平均 0.444,原生提示则是 1.0。「先规范化、再作答」的包装并没能补救,平均分反而降到 0.333——模型判断首字母丢掉的信息太多,三次重复全部拒答,把「自信地答错」变成了「诚实地不答」。原生提示不受影响。这是一个负结果,它被原样写进了论文。

已完成

直接作答 vs 先规范化
0.444 vs 0.333

核心发现:无声调拼音抹掉同音字

三道对抗题都卡在无声调拼音里会塌缩的词上:「事实」与「实施」都是 shi shi;书、树、输、熟都是 shu。原生汉字得 1.00;混合写法——普通指令用拼音、关键术语保留汉字——同样 1.00。而完整拼音、去空格拼音、带错字拼音,平均都只有 0.333:智能体要么把答案原样留成拼音,要么挑错了字。唯一幸存的一题是「买」与「卖」,因为「入」和「出」替它消了歧。混合写法依然省力:按占位模型估算,击键约为原生写法的 0.815。

已完成

原生汉字 · 混合写法
1.00 · 1.00
纯拼音(完整、去空格、错字)
0.333

换一个智能体,边界依旧

在同样三道同音题上,对 Claude Code 做了 9 次真实调用,结果如出一辙:原生与混合写法 1.00,完整拼音平均 0.333。比如拼音 shi shi jian yan,两次都被还原成了「实时检验」,而正确答案应当分别是「事实检验」和「实施检验」。此前两批因基础设施故障被排除,没有计入。这次复核让结论跨越了单一智能体——论文里如实写成一次小规模复核,而不是模型之间的比较。

已完成

有效调用
9

工具在脚下悄悄变了:钉死模型版本

一批准备好的 48 次边界实验(新增了术语表条件),每次调用都报错。原来为了可复现,框架忽略了命令行工具的用户配置,于是回落到工具内置的默认模型,而当前登录的账号恰好用不了它。这批结果如实记为失败,没有当作数据评分;随后显式钉死模型,一次冒烟即确认修复。审计记录还暴露了第二个教训:此前几轮成功实验,究竟用的是哪个模型,并没有记下来。产品化的工具会在脚下悄悄变化——模型 ID 必须钉死。

已完成

投稿 UKAIRS 2026

6 月 8 日,《Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents》投往英国 AI 研究研讨会(UKAIRS 2026):一篇两页论文,Emerging Research 赛道,主题为「人机协同」,排版上专门处理过,好让中文例子在 ACM 模板里正常显示。文中报告 48 次有效的中文纯文本调用——Codex 39 次、Claude Code 9 次——并提出一条设计规则:日常的指令骨架不妨跳过输入法,但确切的人名、领域术语和同音词,必须用原文字锚定。作者:Xiaoxiao Zhouyi、Yanzhen Li,布里斯托大学。

有效调用
48 (39 + 9)
页数
2

扩展到八种文字

下一项研究,在花掉任何一次调用之前就已搭好:8 种语言共 44 道题(264 个提示变体),分为「高风险精确文字」任务与对照组;一个固定的前沿模型矩阵;带配对 bootstrap 置信区间的统计引擎;以及所有图表的生成器。一轮从八种母语视角出发的对抗审计,替换掉了四组其实并不会塌缩的同音词。主实验还在等「跑不跑」的决定,所以目前没有多语言结果——这里也不声称有。

计划中

题目 · 语言 · 变体
44 · 8 · 264

三角审计:三个大脑加一台计算器

一个可复用的审计技能:从三个角度、分几轮攻击一个研究包——能读仓库、能调工具的多智能体工作流,一个强大的外部模型,以及一个数值与实证裁判——模型之间的任何分歧,都靠计算解决,而不是看谁更权威。催生它的那次审计说明了原因:最强的外部模型在一个公式和一个阈值上都错了,而其他参与者各自答对;只有把各方合起来、再加上裁判,才算完整;一次错误的反驳,还倒逼出一份让结论更扎实的认证。

已交付

下一版要测什么

接下来要做的:补上与相关研究的定位;让题目收窄到与中文证据相称;鉴于同音题样本还小,把设计规则的措辞放软;做一个小型打字实验,让「省力」与「质量」两头都靠测量、而不是靠模型估算;用约三十道歧义程度分级的同音题,画出一条真实的性能曲线;钉死每一个模型版本;再深挖「先规范化」为什么反而有害。更广的结论所需的八语言框架,已经就绪。

计划中

录用:第一篇 AI 论文

2026 年 8 月 11 日,UKAIRS 录用本文,在 Emerging Research 赛道的海报场次展示。评审认为问题确有意思、工具看起来实用、包容性的视角值得深挖,并建议以「shi shi」的例子,以及「编码变化—压缩—声调丢失」三层分析作为主信息开场。这是第一篇经同行评审的 AI 论文,第一作者。

已录用

181 号海报,11 月 25 日周三

主办方把海报安排在 2026 年 11 月 25 日(周三)13:15–14:15 的午餐与海报第 3 场,并发来展示指南。官方公开的海报名单上,它是第 181 号,归入「F. 人机协同」主题、Emerging Research 赛道,作者 Xiaoxiao Zhouyi,布里斯托大学。

已排期

UKAIRS 2026,爱丁堡

英国 AI 研究研讨会将于 2026 年 11 月 24–25 日在爱丁堡约翰·麦金泰尔会议中心举行,海报在 25 日(周三)展出。论文里写下的展示方案是并排演示:每道题依次给出原文提示、键盘写法、智能体的回答、评分和输入成本估算——观众可以从日常提示切换到精确术语的压力题,亲眼看到意思在哪里塌掉。本站第 02 章,就是这场演示的初稿。

已排期 · 2026 年 11 月 25 日

证据账本

本章每一条公开条目,附日期、状态与链接。
日期条目状态链接
一种 AI 原生的做数学方式进行中
一条弯向 AI 的研究线进行中
GOSIM 巴黎 2026已参会
ime-eval:键盘友好提示的评测框架已完成
三个模型接力,一个人当裁判已完成
四次调用,四个 bug,然后干净的 1.0已完成
抓住一个隐形的重复已完成
六种写法:先撞天花板,再遇悬崖已完成
反直觉:先还原成中文,反而更糟已完成
核心发现:无声调拼音抹掉同音字已完成
换一个智能体,边界依旧已完成
工具在脚下悄悄变了:钉死模型版本已完成
投稿 UKAIRS 2026
扩展到八种文字计划中
三角审计:三个大脑加一台计算器已交付
下一版要测什么计划中
录用:第一篇 AI 论文已录用
181 号海报,11 月 25 日周三已排期
UKAIRS 2026,爱丁堡已排期 · 2026 年 11 月 25 日