跳过输入法? Skipping the IME?
和 AI 智能体说话,能不能跳过输入法、直接敲拼音?48 次真实调用给出的答案是:日常指令可以;可一遇同音词,意思就塌了——只要把关键词留成汉字,意思便回来了。这是第一篇 AI 论文,入选爱丁堡 UKAIRS 2026。
图 2 — 无声调的拼音是一场游走,随时可能被错误的词吸收。
已录用海报
Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents
Xiaoxiao Zhouyi · Yanzhen Li
图 2.1 shi shi 实测
- 01打字,不经过输入法
- 02智能体听见的
- 03混合提示
- 04得分
01 / 04 · 打字,不经过输入法
你只打出了读音。
7 次击键,不选字,不标调。很快——也有一点失真。
02 / 04 · 智能体听见的
智能体听见的,是 6 个词。
声调本可以区分它们。去掉声调,「事实」「实施」「实时」等词坍缩成同一个字符串。
03 / 04 · 混合提示
关键的那个词,留在汉字里。
句子骨架用拼音,关键术语用汉字。歧义消失,速度还在。
04 / 04 · 得分
三分之一,或者全对。
同音字压力测试——Codex(n = 15)与 Claude Code 复核(n = 9):纯拼音平均 0.333;汉字与混合提示均为 1.00。
- 纯拼音
- 0.333
- 汉字锚定
- 1.00
- 事实 shìshí 真实情况
- 实施 shíshī 付诸执行
- 实时 shíshí 即时
- 时事 shíshì 新闻时事
- 史诗 shǐshī 长篇叙事
- 失事 shīshì 事故
无调拼音到达智能体时只是一个字符串。每个候选词按首达渗流着墨:墨从落笔处进入,每个像素在它的首达时刻变黑(到达场在构建时烘焙)。
图 2.2 同音字星图 示意
输入或选择键码
- shi shi
- shu
- mai
0.13P(想说「事实」) · 在同音词之间均匀猜测(无语境)。
- 事实 shìshí 真实情况
- 实施 shíshī 执行
- 实时 shíshí 即时
- 时事 shíshì 新闻
- 史诗 shǐshī 长篇叙事
- 逝世 shìshì 去世
- 失事 shīshì 事故
- 誓师 shìshī 动员
表 2.1 智能体实际的表现 实测
| 探针 | 对比 | 质量 | n |
|---|---|---|---|
| 算术客观题Codex | 全部六种输入条件 | 全部 1.00 | 6 |
| 骑车好处 JSONCodex | 非首字母写法 vs 首字母简拼 | 0.3331.00 | 6 |
| 简拼稳定性Codex | 原文 vs 首字母简拼(两种模式) | 0.333 / 0.4441.00 | 12 |
| 同音字压力题Codex | 原文 / 混合 vs 纯拼音写法 | 0.3331.00 | 15 |
| 同音字复核Claude Code | 原文 / 混合 vs 完整拼音 | 0.3331.00 | 9 |
| 48 次有效调用 · 简体中文 · 纯文本 · 确定性评分 | 48 | ||
模型交回了什么
shi shi jian yan 应为: 事实检验 · 实施检验 事实检验 · 实施检验
- Codex · 原文写法事实检验 · 实施检验✓
- Codex · 完整拼音shi shi jian yan · shi shi jian yan✗
- Codex · 去空格事实检验 · 事实检验✗
- Codex · 混合写法事实检验 · 实施检验✓
- Claude Code · 完整拼音实时检验 · 实时检验✗
shu 应为: 书 · 树 · 输 · 熟 书 · 树 · 输 · 熟
- Codex · 原文写法书 · 树 · 输 · 熟✓
- Codex · 完整拼音书 · 树 · 数 · 输✗
- Codex · 去空格shu · shu · shu · shu✗
- Codex · 混合写法书 · 树 · 输 · 熟✓
日常的指令骨架不妨跳过输入法;但确切的人名、领域术语与同音词,必须用原文字锚定。
评测框架已定义的输入方式
- 中文拼音丢失 声调与最终的选字
- 日语罗马字丢失 汉字的选择
- 越南语键盘输入丢失 变音符号
- Hinglish(拉丁字母印地语)丢失 原文字的拼写
- Arabizi(拉丁化阿拉伯语)丢失 特定文字的拼写
- 俄语转写丢失 原文字的专名
- Greeklish(拉丁化希腊语)丢失 原文字的专名
- 韩语键盘友好输入丢失 原文字的专名
轮到你 · 坍缩
打一串不带调的拼音
一本小词典,告诉你有多少个词共用这几下击键。读原始拼音的智能体,只能在它们之间猜。
试试
- shi shi
- shou da
- zhou yi xiao xiao
shou da
2 个词共用这几下击键。
去掉声调,我的两条研究线是同一个词:首达(shǒudá),与手打(shǒudǎ)。
展品:论文
Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents
跳过输入法?面向 LLM 智能体的键盘友好多语言提示
UKAIRS 2026 · Emerging Research (poster), Edinburgh ·
已录用 · 181 号海报,2026 年 11 月 25 日,爱丁堡
记录
说中文的人打字,先敲拼音,再让输入法挑字。如果跳过最后这一步,直接把拼音发给 AI 智能体呢?更快——可「事实」和「实施」都是 shi shi。这一章,是一项测量「意思在哪里塌掉」的研究,以及它最后得出的那条规则。
ime-eval 用成对的提示驱动真实的编程智能体——原文写法对照键盘友好写法——规矩很严:默认空跑,每一次真实调用都要授权,结果只写一次。研究分阶段推进,每一阶段花钱之前都由一个独立的智能体审计;负结果也原样保留:让模型先把中文还原出来,反而更糟。
结论小而锋利:日常指令经得起拼音,同音词却经不起——除非把关键词留成汉字,那样就能完全恢复正确。论文入选爱丁堡 UKAIRS 2026。围绕它的,是一种工作方式:模型提出,其他智能体攻击,由计算来裁决。
一种 AI 原生的做数学方式
在首达研究线里,逐渐形成了一个可复用的回路:AI 模型提出推导与代码,另一组智能体专门攻击这些论断,数值计算充当裁判,精确代数交给 Lean 4 机器核验。有据可查的例子包括:提出的公式没通过数值核对,被弃用;基于仓库的审计,抓到了外部模型看不见的错误;每次投稿前的多轮评审——单次审计最多动用约六十个智能体。原则浓缩成一句话:AI 能生成更多科学上的可能,研究者的本事,是判断哪些值得相信。
一条弯向 AI 的研究线
在随机游走的首达研究之外,2026 年的博士工作逐渐延伸到 AI:评测 LLM 智能体,研究人机交互与多语言输入,并把多模型 AI 工作流当作科研仪器——让对抗式审计的分歧由计算来裁决。习惯是一脉相承的:先把隐藏的路径测出来,在有独立证据之前,不轻信任何一个数字。UKAIRS 2026 的录用,是这条线上第一项经同行评审的 AI 成果。
进行中
GOSIM 巴黎 2026
5 月 5–6 日,参加在巴黎 Station F 举办的 GOSIM Paris 2026,主题是「The Agentic AI Convergence」。会后写下的体会是:开源智能体生态正在离开模型展示,转向工具互通、模型服务、边缘部署、生产系统与可信工作流——与评测研究正在走的方向不谋而合。
ime-eval:键盘友好提示的评测框架
问题起于自己:跟智能体说话,能不能直接打拼音?ime-eval 把它变成了一件仪器。它直接驱动真实的命令行编程智能体,而不是裸调 API;每条原文提示都配上一组键盘友好的写法——完整拼音、去空格、轻微错字、首字母简拼,以及只把关键词留作原文字的混合写法;并为八种输入习惯建立配置:日语罗马字、越南语键盘输入、Hinglish、Arabizi、俄语转写、Greeklish、韩语等。从第一天起就立下铁律:配置一律自动生成,默认只做空跑,结果只写一次,用沙箱防止答案泄漏给智能体。框架在此署名,暂未公开。
已完成
- 输入写法
- 8
- 试点提示变体
- 144
三个模型接力,一个人当裁判
整项研究以多个 AI 系统接力的方式推进:一个编排模型写每一阶段的任务书;一个编程智能体负责实现和执行;第三个独立的智能体在花掉任何真实调用之前做就绪审计——同音字阶段它给出的结论是「可以开跑」。每个阶段结束,都打包一份状态与决策交回编排者,每一步都提交进 git。人的角色是总设计师:定阶段,批预算,递接力棒。
已完成
- 独立就绪审计
- 4
四次调用,四个 bug,然后干净的 1.0
在花掉任何一次模型调用之前,先把框架加固:工作目录去泄漏;真实运行由环境变量开闸,并设硬性调用上限;preflight 检查与确定性评分到位;每一步都经独立审计复核。第一次真实冒烟只用了四次授权调用,就揪出四个调用层的 bug——schema 相对路径、输入流阻塞,以及结构化输出的严格规则。修好之后,链路给出正确答案,得分 1.0。测试用例也在这一路上从 47 个增加到 87 个。
已完成
- 首次成功前的调用
- 4
- 发现的 bug
- 4
抓住一个隐形的重复
对全部 24 道试点题做了一次零成本审计,发现「简拼」条件在三道题上(一道中文、两道越南语)与完整罗马化写法逐字节相同——若不察觉,真实调用会被悄悄浪费。现在改用按文字类型区分的确定性转换:中、日、韩的罗马化按音节取首字母(shang dian li 变成 sdl);变体锁文件还记下每条渲染结果的摘要,哪怕只改了代码,也会被漂移检测抓出来。
已完成
六种写法:先撞天花板,再遇悬崖
算术题在六种输入写法下全部答对——证明管道没问题,但题目本身已经饱和。约束类任务开始拉开差距:完整拼音、去空格拼音、带错字的拼音,以及夹英文术语的混合写法,都交出了要求的「三个元素的 JSON 数组」;只有拼音首字母简拼保住了主题、丢掉了结构,得分 0.333。按占位的击键模型估算,首字母简拼只需原生写法约 0.39 的击键——省下的力气是真的,丢掉的质量也是真的。
已完成
- 格式题上的首字母简拼
- 0.333 (native 1.00)
反直觉:先还原成中文,反而更糟
12 次调用的重复实验证实,简拼带来的质量下跌是稳定的:直接回答拼音首字母提示,平均 0.444,原生提示则是 1.0。「先规范化、再作答」的包装并没能补救,平均分反而降到 0.333——模型判断首字母丢掉的信息太多,三次重复全部拒答,把「自信地答错」变成了「诚实地不答」。原生提示不受影响。这是一个负结果,它被原样写进了论文。
已完成
- 直接作答 vs 先规范化
- 0.444 vs 0.333
核心发现:无声调拼音抹掉同音字
三道对抗题都卡在无声调拼音里会塌缩的词上:「事实」与「实施」都是 shi shi;书、树、输、熟都是 shu。原生汉字得 1.00;混合写法——普通指令用拼音、关键术语保留汉字——同样 1.00。而完整拼音、去空格拼音、带错字拼音,平均都只有 0.333:智能体要么把答案原样留成拼音,要么挑错了字。唯一幸存的一题是「买」与「卖」,因为「入」和「出」替它消了歧。混合写法依然省力:按占位模型估算,击键约为原生写法的 0.815。
已完成
- 原生汉字 · 混合写法
- 1.00 · 1.00
- 纯拼音(完整、去空格、错字)
- 0.333
换一个智能体,边界依旧
在同样三道同音题上,对 Claude Code 做了 9 次真实调用,结果如出一辙:原生与混合写法 1.00,完整拼音平均 0.333。比如拼音 shi shi jian yan,两次都被还原成了「实时检验」,而正确答案应当分别是「事实检验」和「实施检验」。此前两批因基础设施故障被排除,没有计入。这次复核让结论跨越了单一智能体——论文里如实写成一次小规模复核,而不是模型之间的比较。
已完成
- 有效调用
- 9
工具在脚下悄悄变了:钉死模型版本
一批准备好的 48 次边界实验(新增了术语表条件),每次调用都报错。原来为了可复现,框架忽略了命令行工具的用户配置,于是回落到工具内置的默认模型,而当前登录的账号恰好用不了它。这批结果如实记为失败,没有当作数据评分;随后显式钉死模型,一次冒烟即确认修复。审计记录还暴露了第二个教训:此前几轮成功实验,究竟用的是哪个模型,并没有记下来。产品化的工具会在脚下悄悄变化——模型 ID 必须钉死。
已完成
投稿 UKAIRS 2026
6 月 8 日,《Skipping the IME? Keyboard-Friendly Multilingual Prompting for LLM Agents》投往英国 AI 研究研讨会(UKAIRS 2026):一篇两页论文,Emerging Research 赛道,主题为「人机协同」,排版上专门处理过,好让中文例子在 ACM 模板里正常显示。文中报告 48 次有效的中文纯文本调用——Codex 39 次、Claude Code 9 次——并提出一条设计规则:日常的指令骨架不妨跳过输入法,但确切的人名、领域术语和同音词,必须用原文字锚定。作者:Xiaoxiao Zhouyi、Yanzhen Li,布里斯托大学。
已投稿
- 有效调用
- 48 (39 + 9)
- 页数
- 2
扩展到八种文字
下一项研究,在花掉任何一次调用之前就已搭好:8 种语言共 44 道题(264 个提示变体),分为「高风险精确文字」任务与对照组;一个固定的前沿模型矩阵;带配对 bootstrap 置信区间的统计引擎;以及所有图表的生成器。一轮从八种母语视角出发的对抗审计,替换掉了四组其实并不会塌缩的同音词。主实验还在等「跑不跑」的决定,所以目前没有多语言结果——这里也不声称有。
计划中
- 题目 · 语言 · 变体
- 44 · 8 · 264
三角审计:三个大脑加一台计算器
一个可复用的审计技能:从三个角度、分几轮攻击一个研究包——能读仓库、能调工具的多智能体工作流,一个强大的外部模型,以及一个数值与实证裁判——模型之间的任何分歧,都靠计算解决,而不是看谁更权威。催生它的那次审计说明了原因:最强的外部模型在一个公式和一个阈值上都错了,而其他参与者各自答对;只有把各方合起来、再加上裁判,才算完整;一次错误的反驳,还倒逼出一份让结论更扎实的认证。
已交付
下一版要测什么
接下来要做的:补上与相关研究的定位;让题目收窄到与中文证据相称;鉴于同音题样本还小,把设计规则的措辞放软;做一个小型打字实验,让「省力」与「质量」两头都靠测量、而不是靠模型估算;用约三十道歧义程度分级的同音题,画出一条真实的性能曲线;钉死每一个模型版本;再深挖「先规范化」为什么反而有害。更广的结论所需的八语言框架,已经就绪。
计划中
录用:第一篇 AI 论文
2026 年 8 月 11 日,UKAIRS 录用本文,在 Emerging Research 赛道的海报场次展示。评审认为问题确有意思、工具看起来实用、包容性的视角值得深挖,并建议以「shi shi」的例子,以及「编码变化—压缩—声调丢失」三层分析作为主信息开场。这是第一篇经同行评审的 AI 论文,第一作者。
已录用
181 号海报,11 月 25 日周三
主办方把海报安排在 2026 年 11 月 25 日(周三)13:15–14:15 的午餐与海报第 3 场,并发来展示指南。官方公开的海报名单上,它是第 181 号,归入「F. 人机协同」主题、Emerging Research 赛道,作者 Xiaoxiao Zhouyi,布里斯托大学。
已排期
UKAIRS 2026,爱丁堡
英国 AI 研究研讨会将于 2026 年 11 月 24–25 日在爱丁堡约翰·麦金泰尔会议中心举行,海报在 25 日(周三)展出。论文里写下的展示方案是并排演示:每道题依次给出原文提示、键盘写法、智能体的回答、评分和输入成本估算——观众可以从日常提示切换到精确术语的压力题,亲眼看到意思在哪里塌掉。本站第 02 章,就是这场演示的初稿。
已排期 · 2026 年 11 月 25 日
证据账本
| 日期 | 条目 | 状态 | 链接 |
|---|---|---|---|
| 一种 AI 原生的做数学方式 | 进行中 | ||
| 一条弯向 AI 的研究线 | 进行中 | 无公开链接 | |
| GOSIM 巴黎 2026 | 已参会 | ||
| ime-eval:键盘友好提示的评测框架 | 已完成 | 无公开链接 | |
| 三个模型接力,一个人当裁判 | 已完成 | 无公开链接 | |
| 四次调用,四个 bug,然后干净的 1.0 | 已完成 | 无公开链接 | |
| 抓住一个隐形的重复 | 已完成 | 无公开链接 | |
| 六种写法:先撞天花板,再遇悬崖 | 已完成 | 无公开链接 | |
| 反直觉:先还原成中文,反而更糟 | 已完成 | 无公开链接 | |
| 核心发现:无声调拼音抹掉同音字 | 已完成 | 无公开链接 | |
| 换一个智能体,边界依旧 | 已完成 | 无公开链接 | |
| 工具在脚下悄悄变了:钉死模型版本 | 已完成 | 无公开链接 | |
| 投稿 UKAIRS 2026 | 已投稿 | 无公开链接 | |
| 扩展到八种文字 | 计划中 | 无公开链接 | |
| 三角审计:三个大脑加一台计算器 | 已交付 | 无公开链接 | |
| 下一版要测什么 | 计划中 | 无公开链接 | |
| 录用:第一篇 AI 论文 | 已录用 | ||
| 181 号海报,11 月 25 日周三 | 已排期 | ||
| UKAIRS 2026,爱丁堡 | 已排期 · 2026 年 11 月 25 日 |