Files
jackwener__opencli/clis/youtube/transcript-group.test.ts
jakevin 80eef46b4e refactor: monorepo adapter separation (clis/ at root) (#782)
* refactor: move adapters from src/clis/ to root clis/ for monorepo separation

Separates CLI adapters from the core runtime to prepare for independent
adapter distribution via postinstall fetch.

Key changes:
- Move src/clis/ → clis/ (adapters at repo root)
- Change tsconfig rootDir from "src" to "." so tsc compiles both
- Create root-level shim files (registry.ts, errors.ts, etc.) so adapter
  relative imports (../../registry.js) resolve correctly
- Update build-manifest.ts, main.ts paths for new dist/src/ structure
- Expand ensureUserCliCompatShims() to cover all adapter import targets
  (types, utils, logger, launcher, browser/*, download/*, pipeline/*)
- Add scripts/fetch-adapters.js postinstall for ~/.opencli/clis/ sync
- Update vitest.config.ts adapter test paths
- Add package.json files field to exclude adapters from npm package

Official adapter files are unconditionally overwritten on update;
user-created files not in the manifest are preserved.

* fix: add dist/clis/ and cli-manifest.json to npm files, harden fetch-adapters

- Add dist/clis/ and dist/cli-manifest.json to package.json files field
  so built-in adapters and manifest ship with the npm package
- Replace execSync with execFileSync to prevent command injection
- Add version check to skip redundant adapter fetches
- Track tmpRoot explicitly for reliable cleanup

* fix: address review blockers — manifest-based updates, global-only fetch, first-run fallback

1. Manifest-based update strategy:
   - Read old manifest to identify previously-official files
   - Clean up files removed upstream (in old manifest but not new)
   - User-created files (never in any manifest) remain untouched

2. Only run fetch-adapters on global install (npm_config_global=true)
   or explicit OPENCLI_FETCH=1, preventing heavy side effects for
   local/dev installs

3. First-run fallback in discovery.ts:
   - ensureUserAdapters() checks for adapter-manifest.json
   - If missing and ~/.opencli/clis/ is empty, spawns fetch-adapters.js
   - Guarantees adapters are available even with --ignore-scripts

* fix: remove OPENCLI_FETCH env var, use internal _OPENCLI_FIRST_RUN instead

* feat: also support OPENCLI_FETCH=1 for explicit adapter fetch trigger

* simplify: replace git clone with local copy from dist/clis/

Adapters already ship in the npm package (dist/clis/), so there's no
need to clone from GitHub. Copy directly from the installed package:

- Eliminates git, curl, tar dependencies
- No network calls in postinstall
- No timeout/offline issues
- Version always matches the installed CLI
- ~65 lines of clone/download code replaced by one cpSync loop
2026-04-05 01:46:36 +08:00

109 lines
4.0 KiB
TypeScript

import { describe, it, expect } from 'vitest';
import { groupTranscriptSegments, formatGroupedTranscript } from './transcript-group.js';
describe('groupTranscriptSegments', () => {
it('groups segments by sentence boundaries', () => {
const segments = [
{ start: 0, text: 'Hello there.' },
{ start: 2, text: 'How are you doing today?' },
{ start: 5, text: 'I am' },
{ start: 6, text: 'doing well.' },
];
const result = groupTranscriptSegments(segments);
expect(result).toHaveLength(3);
expect(result[0].text).toBe('Hello there.');
expect(result[1].text).toBe('How are you doing today?');
expect(result[2].text).toBe('I am doing well.');
});
it('flushes on large time gaps', () => {
const segments = [
{ start: 0, text: 'First part' },
{ start: 2, text: 'still first' },
{ start: 25, text: 'second part after gap' },
];
const result = groupTranscriptSegments(segments);
expect(result).toHaveLength(2);
expect(result[0].text).toBe('First part still first');
expect(result[1].text).toBe('second part after gap');
});
it('respects 30s max group span for unpunctuated text', () => {
// Simulate CJK captions without punctuation
const segments = Array.from({ length: 20 }, (_, i) => ({
start: i * 2,
text: `segment${i}`,
}));
const result = groupTranscriptSegments(segments);
// 20 segments * 2s = 40s total, should be split into at least 2 groups
expect(result.length).toBeGreaterThanOrEqual(2);
// No single group should span more than ~30s
for (const g of result) {
const words = g.text.split(' ');
// With 2s per segment and 30s max, each group should have at most ~16 segments
expect(words.length).toBeLessThanOrEqual(16);
}
});
it('detects speaker changes via >> markers', () => {
const segments = [
{ start: 0, text: '>> How are you?' },
{ start: 3, text: '>> I am fine.' },
];
const result = groupTranscriptSegments(segments);
expect(result.some(g => g.speakerChange)).toBe(true);
expect(result.some(g => g.speaker !== undefined)).toBe(true);
});
it('recognizes CJK sentence-ending punctuation', () => {
const segments = [
{ start: 0, text: '你好世界。' },
{ start: 2, text: '这是测试' },
{ start: 4, text: '内容。' },
];
const result = groupTranscriptSegments(segments);
expect(result).toHaveLength(2);
expect(result[0].text).toBe('你好世界。');
expect(result[1].text).toBe('这是测试 内容。');
});
it('returns empty array for empty input', () => {
expect(groupTranscriptSegments([])).toEqual([]);
});
});
describe('formatGroupedTranscript', () => {
it('formats timestamps correctly', () => {
const segments = [
{ start: 65, text: 'One minute five.', speakerChange: false },
{ start: 3661, text: 'One hour one minute.', speakerChange: false },
];
const { rows } = formatGroupedTranscript(segments);
expect(rows[0].timestamp).toBe('1:05');
expect(rows[1].timestamp).toBe('1:01:01');
});
it('inserts chapter headings at correct positions', () => {
const segments = [
{ start: 0, text: 'Intro text.', speakerChange: false },
{ start: 60, text: 'Chapter content.', speakerChange: false },
];
const chapters = [{ title: 'Introduction', start: 0 }, { title: 'Main', start: 50 }];
const { rows } = formatGroupedTranscript(segments, chapters);
expect(rows[0].text).toBe('[Chapter] Introduction');
expect(rows[1].text).toBe('Intro text.');
expect(rows[2].text).toBe('[Chapter] Main');
expect(rows[3].text).toBe('Chapter content.');
});
it('labels speakers', () => {
const segments = [
{ start: 0, text: 'Hello.', speakerChange: true, speaker: 0 },
{ start: 5, text: 'Hi there.', speakerChange: true, speaker: 1 },
];
const { rows } = formatGroupedTranscript(segments);
expect(rows[0].speaker).toBe('Speaker 1');
expect(rows[1].speaker).toBe('Speaker 2');
});
});